Sværhedsgrad
Din bedste score
N/A
Formålet med denne opgave er at identificere og klassificere tekster baseret på regionale særtræk eller den rumænske standardform. Datasættet indeholder tekstfragmenter indsamlet fra forskellige regioner.
| Kolonne | Beskrivelse |
|---|---|
| ID | Unik identifikator for hvert tekstfragment |
| text | Selve indholdet af sætningen på rumænsk |
| label | Klassificering af tekstens dialekt (målkolonne) |
Bemærk: Kolonnen label (Dialekten) er kun tilgængelig i træningsdata (train.csv). De tre mulige klasser er: româna standard (standardrumænsk), graiul moldovenesc (moldovisk dialekt) og graiul bănățean (banat-dialekt).
En del af teksterne er udtrukket fra værket "Cinci pâini" af Ion Creangă. Beregn det samlede antal forekomster af ordet "pâni" (den arkaiske form af ordet "pâini") i train.csv og i test.csv.
I train.csv skal du beregne gennemsnittet af antallet af tegnsætningstegn for tekster på graiul moldovenesc og graiul bănățean. Returner den absolutte værdi (modulus) af forskellen mellem de 2 værdier, afrundet til 2 decimaler.
For hver række i test.csv skal du beregne antallet af diakritiske tegn i teksten. Følgende tegn betragtes som diakritiske tegn: ă, â, î, ș, ț (og deres store bogstaver Ă, Â, Î, Ș, Ț).
Byg en model, der er i stand til korrekt at klassificere teksterne i testfilen i en af de 3 klasser.
Evalueringen sker ved nøjagtig verifikation af svaret. Korrekt svar = maksimale point, forkert svar = 0 point.
Evalueringen sker ved accuracy — andelen af korrekte svar ud af de samlede svar. Pointgivningen er proportionel: accuracy 1.0 = 10 point, accuracy 0.0 = 0 point.
Evalueringen sker ved hjælp af metrikken F1-Macro.
Submissionsfilen skal være i CSV-format og indeholde følgende kolonner:
1.ID i test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Bemærk: Løsningen af denne opgave kræver ikke brug af Transformer-arkitekturer (f.eks. RoBERTa).