Difficoltà
Il tuo miglior punteggio
N/D
Lo scopo di questo problema è l'identificazione e la classificazione dei testi in base alla specificità regionale o alla forma standard della lingua rumena. Il set di dati contiene frammenti di testo raccolti da diverse regioni.
| Colonna | Descrizione |
|---|---|
| ID | Identificatore unico per ogni frammento di testo |
| text | Il contenuto effettivo della frase in lingua rumena |
| label | Classificazione del dialetto del testo (colonna target) |
Nota: La colonna label (Dialetto) è disponibile solo nei dati di addestramento (train.csv). Le tre classi possibili sono: româna standard (rumeno standard), graiul moldovenesc (dialetto moldavo) e graiul bănățean (dialetto del Banato).
Una parte dei testi è stata estratta dall'opera "Cinci pâini" di Ion Creangă. Calcola il numero totale di occorrenze della parola "pâni" (forma arcaica della parola "pâini") in train.csv e in test.csv.
In train.csv calcola la media del numero di segni di punteggiatura per i testi in graiul moldovenesc e graiul bănățean. Restituisci il valore assoluto (modulo) della differenza tra i due valori, arrotondato a 2 decimali.
Per ogni riga di test.csv calcola il numero di diacritici nel testo. Sono considerati diacritici i caratteri: ă, â, î, ș, ț (e le loro varianti maiuscole Ă, Â, Î, Ș, Ț).
Costruisci un modello capace di classificare correttamente i testi del file di test in una delle 3 classi.
La valutazione viene effettuata tramite verifica esatta della risposta. Risposta corretta = punteggio massimo, risposta errata = 0 punti.
La valutazione viene effettuata tramite accuracy — la proporzione di risposte corrette sul totale. Il punteggio è proporzionale: accuracy 1.0 = 10 punti, accuracy 0.0 = 0 punti.
La valutazione viene effettuata utilizzando la metrica F1-Macro.
Il file di sottomissione deve essere in formato CSV, contenente le seguenti colonne:
1.ID di test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Nota: La risoluzione di questo problema non richiede l'utilizzo di architetture di tipo Transformer (es: RoBERTa).