Težina
Vaš najbolji rezultat
N/D
Cilj ovog problema je identifikacija i klasifikacija tekstova prema regionalnim specifičnostima ili standardnom obliku rumunjskog jezika. Skup podataka sadrži fragmente teksta prikupljene iz različitih regija.
| Stupac | Opis |
|---|---|
| ID | Jedinstveni identifikator za svaki fragment teksta |
| text | Stvarni sadržaj fraze na rumunjskom jeziku |
| label | Klasifikacija dijalekta teksta (ciljni stupac) |
Napomena: Stupac label (Dijalekt) dostupan je samo u podacima za treniranje (train.csv). Tri moguće klase su: româna standard (standardni rumunjski), graiul moldovenesc (moldavski govor) i graiul bănățean (banatski govor).
Dio tekstova izvučen je iz djela "Cinci pâini" autora Iona Creange. Izračunajte ukupni broj pojavljivanja riječi "pâni" (arhaični oblik riječi "pâini") u train.csv i test.csv.
U train.csv izračunajte prosječan broj znakova interpunkcije za tekstove na moldavskom govoru i banatskom govoru. Vratite apsolutnu vrijednost razlike između te dvije vrijednosti, zaokruženu na 2 decimale.
Za svaki redak u test.csv izračunajte broj dijakritičkih znakova u tekstu. Dijakriticima se smatraju znakovi: ă, â, î, ș, ț (i njihove varijante velikih slova Ă, Â, Î, Ș, Ț).
Izgradite model sposoban ispravno klasificirati tekstove iz testne datoteke u jednu od 3 klase.
Evaluacija se vrši točnom provjerom odgovora. Točan odgovor = maksimalni bodovi, pogrešan odgovor = 0 bodova.
Evaluacija se vrši putem accuracy — udjela točnih odgovora u ukupnom broju. Bodovanje je proporcionalno: accuracy 1.0 = 10 bodova, accuracy 0.0 = 0 bodova.
Evaluacija se vrši pomoću metrike F1-Macro.
Datoteka za slanje mora biti u CSV formatu i sadržavati sljedeće stupce:
1.ID u test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Napomena: Rješavanje ovog problema ne zahtijeva korištenje arhitektura tipa Transformer (npr. RoBERTa).