Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Šī uzdevuma mērķis ir identificēt un klasificēt tekstus atkarībā no reģionālajām īpatnībām vai rumāņu valodas standarta formas. Datu kopa satur teksta fragmentus, kas savākti no dažādiem reģioniem.
| Kolonna | Apraksts |
|---|---|
| ID | Unikāls identifikators katram teksta fragmentam |
| text | Pašas frāzes saturs rumāņu valodā |
| label | Teksta dialekta klasifikācija (mērķa kolonna) |
Piezīme: Kolonna label (Dialekts) ir pieejama tikai apmācības datos (train.csv). Trīs iespējamās klases ir: româna standard (standarta rumāņu), graiul moldovenesc (moldāvu izloksne) un graiul bănățean (Banātas izloksne).
Daļa tekstu ir ņemti no Jona Kreanges darba "Cinci pâini". Aprēķiniet vārda "pâni" (vārda "pâini" arhaiskā forma) kopējo parādīšanās skaitu failos train.csv un test.csv.
Failā train.csv aprēķiniet vidējo pieturzīmju skaitu tekstiem graiul moldovenesc un graiul bănățean klasēs. Atgrieziet starpības absolūto vērtību (moduli) starp šīm divām vērtībām, noapaļotu līdz 2 zīmēm aiz komata.
Katrai rindai failā test.csv aprēķiniet diakritisko zīmju skaitu tekstā. Par diakritiskajām zīmēm tiek uzskatītas rakstzīmes: ă, â, î, ș, ț (un to lielie burti Ă, Â, Î, Ș, Ț).
Izveidojiet modeli, kas spēj pareizi klasificēt testa faila tekstus vienā no 3 klasēm.
Vērtēšana tiek veikta, precīzi pārbaudot atbildi. Pareiza atbilde = maksimālais punktu skaits, nepareiza atbilde = 0 punkti.
Vērtēšana tiek veikta, izmantojot accuracy — pareizo atbilžu proporciju pret kopējo skaitu. Punktu skaits ir proporcionāls: accuracy 1.0 = 10 punkti, accuracy 0.0 = 0 punkti.
Vērtēšana tiek veikta, izmantojot F1-Macro metriku.
Iesniegšanas failam jābūt CSV formātā ar šādām kolonnām:
1.ID failā test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Piezīme: Šī uzdevuma risināšanai nav nepieciešams izmantot Transformer tipa arhitektūras (piemēram: RoBERTa).