Težavnost
Vaš najboljši rezultat
N/A
Namen te težave je identifikacija in klasifikacija besedil glede na regionalne značilnosti ali standardno obliko romunskega jezika. Nabor podatkov vsebuje fragmente besedil, zbrane iz različnih regij.
| Stolpec | Opis |
|---|---|
| ID | Edinstven identifikator za vsak fragment besedila |
| text | Dejanska vsebina stavka v romunščini |
| label | Klasifikacija narečja besedila (ciljni stolpec) |
Opomba: Stolpec label (Narečje) je na voljo samo v podatkih za učenje (train.csv). Tri možni razredi so: româna standard (standardna romunščina), graiul moldovenesc (moldavsko narečje) in graiul bănățean (banatsko narečje).
Del besedil je bil vzet iz dela "Cinci pâini" avtorja Iona Creange. Izračunajte skupno število pojavitev besede "pâni" (arhaična oblika besede "pâini") v datotekah train.csv in test.csv.
V train.csv izračunajte povprečno število ločil za besedila v graiul moldovenesc in graiul bănățean. Vrnite absolutno vrednost razlike med tema dvema vrednostma, zaokroženo na 2 decimalni mesti.
Za vsako vrstico v test.csv izračunajte število diakritičnih znakov v besedilu. Za diakritične znake se štejejo: ă, â, î, ș, ț (in njihove velike različice Ă, Â, Î, Ș, Ț).
Zgradite model, ki je sposoben pravilno razvrstiti besedila iz testne datoteke v enega izmed 3 razredov.
Ocenjevanje poteka s točnim preverjanjem odgovora. Pravilen odgovor = polno število točk, napačen odgovor = 0 točk.
Ocenjevanje poteka z accuracy — deležem pravilnih odgovorov od vseh. Točkovanje je sorazmerno: accuracy 1.0 = 10 točk, accuracy 0.0 = 0 točk.
Ocenjevanje poteka z uporabo metrike F1-Macro.
Datoteka za oddajo mora biti v formatu CSV in vsebovati naslednje stolpce:
1.ID v test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Opomba: Reševanje te težave ne zahteva uporabe arhitektur tipa Transformer (npr. RoBERTa).