Тежина
Твој најбољи резултат
Н/Д
Cilj ovog problema je identifikacija i klasifikacija tekstova prema regionalnim specifičnostima ili standardnom obliku rumunskog jezika. Skup podataka sadrži fragmente teksta prikupljene iz različitih regiona.
| Kolona | Opis |
|---|---|
| ID | Jedinstveni identifikator za svaki fragment teksta |
| text | Sam sadržaj fraze na rumunskom jeziku |
| label | Klasifikacija dijalekta teksta (ciljna kolona) |
Napomena: Kolona label (Dijalekt) dostupna je samo u podacima za obuku (train.csv). Tri moguće klase su: româna standard (standardni rumunski), graiul moldovenesc (moldavski govor) i graiul bănățean (banatski govor).
Deo tekstova je izvučen iz dela "Cinci pâini" Jona Kreange. Izračunajte ukupan broj pojavljivanja reči "pâni" (arhaični oblik reči "pâini") u train.csv i test.csv.
U train.csv izračunajte prosečan broj znakova interpunkcije za tekstove na moldavskom govoru i banatskom govoru. Vratite apsolutnu vrednost (modul) razlike između ove dve vrednosti, zaokruženu na 2 decimale.
Za svaki red u test.csv izračunajte broj dijakritičkih znakova u tekstu. Dijakriticima se smatraju karakteri: ă, â, î, ș, ț (i njihove varijante sa velikim slovima Ă, Â, Î, Ș, Ț).
Konsturišite model sposoban da ispravno klasifikuje tekstove iz test datoteke u jednu od 3 klase.
Evaluacija se vrši tačnom proverom odgovora. Tačan odgovor = maksimalan broj poena, pogrešan odgovor = 0 poena.
Evaluacija se vrši putem accuracy — proporcije tačnih odgovora u odnosu na ukupan broj. Bodovanje je proporcionalno: accuracy 1.0 = 10 poena, accuracy 0.0 = 0 poena.
Evaluacija se vrši korišćenjem F1-Macro metrike.
Datoteka za slanje mora biti u CSV formatu i sadržati sledeće kolone:
1.ID u test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Napomena: Rešavanje ovog problema ne zahteva korišćenje arhitektura tipa Transformer (npr. RoBERTa).