Vanskelighetsgrad
Din beste poengsum
N/A
Målet med denne oppgaven er å identifisere og klassifisere tekster basert på regionale særtrekk eller den standardiserte formen av det rumenske språket. Datasettet inneholder tekstfragmenter samlet inn fra ulike regioner.
| Kolonne | Beskrivelse |
|---|---|
| ID | Unik identifikator for hvert tekstfragment |
| text | Selve innholdet i setningen på rumensk |
| label | Klassifisering av tekstens dialekt (målkolonne) |
Merk: Kolonnen label (dialekten) er kun tilgjengelig i treningsdataene (train.csv). De tre mulige klassene er: româna standard (standard rumensk), graiul moldovenesc (moldovisk dialekt) og graiul bănățean (Banat-dialekt).
En del av tekstene er hentet fra verket "Cinci pâini" av Ion Creangă. Beregn det totale antallet forekomster av ordet "pâni" (den arkaiske formen av ordet "pâini") i train.csv og i test.csv.
I train.csv, beregn gjennomsnittlig antall tegnsettingstegn for tekstene i graiul moldovenesc og graiul bănățean. Returner den absolutte verdien (differansen) mellom de to verdiene, avrundet til 2 desimaler.
For hver rad i test.csv, beregn antall diakritiske tegn i teksten. Følgende tegn regnes som diakritiske: ă, â, î, ș, ț (og deres store varianter Ă, Â, Î, Ș, Ț).
Bygg en modell som er i stand til å klassifisere tekstene i testfilen korrekt i en av de 3 klassene.
Evalueringen gjøres ved nøyaktig sjekk av svaret. Riktig svar = maksimal poengsum, feil svar = 0 poeng.
Evalueringen gjøres ved accuracy — andelen riktige svar av totalen. Poengsummen er proporsjonal: accuracy 1.0 = 10 poeng, accuracy 0.0 = 0 poeng.
Evalueringen gjøres ved bruk av metrikken F1-Macro.
Innleveringsfilen må være i CSV-format og inneholde følgende kolonner:
1.ID-kolonnen i test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Merk: Løsningen av denne oppgaven krever ikke bruk av Transformer-arkitekturer (f.eks. RoBERTa).