Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Syftet med denna uppgift är att identifiera och klassificera texter baserat på regionala särdrag eller den rumänska standardspråksformen. Datasetet innehåller textfragment insamlade från olika regioner.
| Kolumn | Beskrivning |
|---|---|
| ID | Unik identifierare för varje textfragment |
| text | Själva innehållet i frasen på rumänska |
| label | Klassificering av textens dialekt (målkolumn) |
Notera: Kolumnen label (Dialekten) är endast tillgänglig i träningsdata (train.csv). De tre möjliga klasserna är: româna standard (standardrumänska), graiul moldovenesc (moldaviska) och graiul bănățean (banat-dialekt).
En del av texterna har extraherats från verket "Cinci pâini" av Ion Creangă. Beräkna det totala antalet förekomster av ordet "pâni" (den arkaiska formen av ordet "pâini") i train.csv och i test.csv.
Beräkna i train.csv genomsnittligt antal skiljetecken för texter på graiul moldovenesc och graiul bănățean. Returnera det absoluta värdet (differensen) mellan de två värdena, avrundat till 2 decimaler.
Beräkna antalet diakritiska tecken i texten för varje rad i test.csv. Följande tecken räknas som diakritiska: ă, â, î, ș, ț (och deras versala varianter Ă, Â, Î, Ș, Ț).
Bygg en modell som kan klassificera texterna i testfilen korrekt i en av de 3 klasserna.
Utvärderingen sker genom exakt kontroll av svaret. Rätt svar = maximal poäng, fel svar = 0 poäng.
Utvärderingen sker genom accuracy — andelen korrekta svar av det totala antalet. Poängen är proportionell: accuracy 1.0 = 10 poäng, accuracy 0.0 = 0 poäng.
Utvärderingen sker med mätvärdet F1-Macro.
Inlämningsfilen ska vara i CSV-format och innehålla följande kolumner:
1.ID i test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Notera: Lösningen av denna uppgift kräver inte användning av Transformer-arkitekturer (t.ex. RoBERTa).