Raskusaste
Sinu parim tulemus
Puudub
Selle ülesande eesmärk on tuvastada ja klassifitseerida tekste vastavalt piirkondlikule spetsiifikale või rumeenia keele standardvormile. Andmestik sisaldab erinevatest piirkondadest kogutud tekstifragmente.
| Veerg | Kirjeldus |
|---|---|
| ID | Iga tekstifragmendi kordumatu identifikaator |
| text | Lause sisu rumeenia keeles |
| label | Teksti murde klassifikatsioon (sihtveerg) |
Märkus: Veerg label (murre) on saadaval ainult treeningandmetes (train.csv). Kolm võimalikku klassi on: româna standard (standardrumeenia), graiul moldovenesc (moldova murre) ja graiul bănățean (banaadi murre).
Osa tekstidest on pärit Ion Creangă teosest "Cinci pâini". Arvutage sõna "pâni" (sõna "pâini" arhailine vorm) esinemiste koguarv failides train.csv ja test.csv.
Arvutage failis train.csv kirjavahemärkide keskmine arv graiul moldovenesc ja graiul bănățean tekstide kohta. Tagastage nende kahe väärtuse vahe absoluutväärtus (moodul), ümardatuna 2 komakohani.
Arvutage iga test.csv rea kohta diakriitiliste märkide arv tekstis. Diakriitikuteks loetakse tähemärke: ă, â, î, ș, ț (ja nende suurtähevormid Ă, Â, Î, Ș, Ț).
Koostage mudel, mis suudab testfaili tekstid õigesti ühte kolmest klassist klassifitseerida.
Hindamine toimub vastuse täpse kontrollimise teel. Õige vastus = maksimaalsed punktid, vale vastus = 0 punkti.
Hindamine toimub accuracy (täpsuse) põhjal — õigete vastuste osakaal koguarvust. Punktisumma on proportsionaalne: accuracy 1.0 = 10 punkti, accuracy 0.0 = 0 punkti.
Hindamine toimub F1-Macro meetrika abil.
Esitatav fail peab olema CSV-vormingus ja sisaldama järgmisi veerge:
1.ID failis test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Märkus: Selle ülesande lahendamine ei nõua Transformer-tüüpi arhitektuuride (nt RoBERTa) kasutamist.