Moeilijkheid
Jouw beste score
N.v.t.
Het doel van dit probleem is het identificeren en classificeren van teksten op basis van regionale kenmerken of de standaardvorm van de Roemeense taal. De dataset bevat tekstfragmenten verzameld uit verschillende regio's.
| Kolom | Beschrijving |
|---|---|
| ID | Unieke identificatie voor elk tekstfragment |
| text | De eigenlijke inhoud van de zin in het Roemeens |
| label | De classificatie van het dialect van de tekst (doelkolom) |
Opmerking: De kolom label (Dialect) is alleen beschikbaar in de trainingsgegevens (train.csv). De drie mogelijke klassen zijn: româna standard (standaard Roemeens), graiul moldovenesc (Moldavisch dialect) en graiul bănățean (Banaat-dialect).
Een deel van de teksten is afkomstig uit het werk "Cinci pâini" van Ion Creangă. Bereken het totaal aantal keren dat het woord "pâni" (de archaïsche vorm van het woord "pâini") voorkomt in train.csv en in test.csv.
Bereken in train.csv het gemiddelde aantal leestekens voor de teksten in het graiul moldovenesc en het graiul bănățean. Geef de absolute waarde (modulus) van het verschil tussen deze 2 waarden, afgerond op 2 decimalen.
Bereken voor elke rij in test.csv het aantal diakritische tekens in de tekst. Als diakritische tekens worden beschouwd: ă, â, î, ș, ț (en hun hoofdlettervarianten Ă, Â, Î, Ș, Ț).
Bouw een model dat in staat is om de teksten uit het testbestand correct te classificeren in een van de 3 klassen.
De evaluatie gebeurt door exacte controle van het antwoord. Correct antwoord = maximale score, fout antwoord = 0 punten.
De evaluatie gebeurt op basis van accuracy — het aandeel correcte antwoorden van het totaal. De score is proportioneel: accuracy 1.0 = 10 punten, accuracy 0.0 = 0 punten.
De evaluatie gebeurt met de F1-Macro metriek.
Het indieningsbestand moet in CSV-formaat zijn en de volgende kolommen bevatten:
1.ID in test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Opmerking: Het oplossen van dit probleem vereist geen gebruik van Transformer-architecturen (bijv. RoBERTa).