Obtížnost
Vaše nejlepší skóre
N/A
Cílem této úlohy je identifikace a klasifikace textů na základě regionálních specifik nebo standardní formy rumunského jazyka. Datová sada obsahuje úryvky textů shromážděné z různých regionů.
| Sloupec | Popis |
|---|---|
| ID | Unikátní identifikátor pro každý úryvek textu |
| text | Samotný obsah věty v rumunštině |
| label | Klasifikace dialektu textu (cílový sloupec) |
Poznámka: Sloupec label (Dialekt) je k dispozici pouze v trénovacích datech (train.csv). Tři možné třídy jsou: româna standard (standardní rumunština), graiul moldovenesc (moldavské nářečí) a graiul bănățean (banátské nářečí).
Část textů byla vybrána z díla „Cinci pâini“ od Iona Creangă. Vypočítejte celkový počet výskytů slova „pâni“ (archaická forma slova „pâini“) v souborech train.csv a test.csv.
V souboru train.csv vypočítejte průměrný počet interpunkčních znamének pro texty v graiul moldovenesc a graiul bănățean. Vrátí absolutní hodnotu rozdílu mezi těmito dvěma hodnotami, zaokrouhlenou na 2 desetinná místa.
Pro každý řádek v test.csv vypočítejte počet diakritických znamének v textu. Za diakritiku se považují znaky: ă, â, î, ș, ț (a jejich varianty velkými písmeny Ă, Â, Î, Ș, Ț).
Sestavte model schopný správně klasifikovat texty z testovacího souboru do jedné ze 3 tříd.
Hodnocení probíhá přesným ověřením odpovědi. Správná odpověď = plný počet bodů, špatná odpověď = 0 bodů.
Hodnocení probíhá pomocí accuracy — podílu správných odpovědí z celkového počtu. Bodování je proporcionální: accuracy 1.0 = 10 bodů, accuracy 0.0 = 0 bodů.
Hodnocení probíhá pomocí metriky F1-Macro.
Soubor pro odevzdání musí být ve formátu CSV a obsahovat následující sloupce:
1.ID v test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Poznámka: Řešení tohoto problému nevyžaduje použití architektur typu Transformer (např. RoBERTa).