Trudność
Twój najlepszy wynik
Nie dotyczy
Celem tego zadania jest identyfikacja i klasyfikacja tekstów na podstawie specyfiki regionalnej lub standardowej formy języka rumuńskiego. Zbiór danych zawiera fragmenty tekstów zebranych z różnych regionów.
| Kolumna | Opis |
|---|---|
| ID | Unikalny identyfikator dla każdego fragmentu tekstu |
| text | Właściwa treść frazy w języku rumuńskim |
| label | Klasyfikacja dialektu tekstu (kolumna docelowa) |
Uwaga: Kolumna label (Dialekt) jest dostępna tylko w danych treningowych (train.csv). Trzy możliwe klasy to: româna standard (standardowy rumuński), graiul moldovenesc (gwara mołdawska) i graiul bănățean (gwara banacka).
Część tekstów została wyodrębniona z dzieła „Cinci pâini” autorstwa Iona Creangi. Oblicz całkowitą liczbę wystąpień słowa „pâni” (archaiczna forma słowa „pâini”) w plikach train.csv oraz test.csv.
W pliku train.csv oblicz średnią liczbę znaków interpunkcyjnych dla tekstów w gwara mołdawska i gwara banacka. Zwróć wartość bezwzględną różnicy między tymi dwiema wartościami, zaokrągloną do 2 miejsc po przecinku.
Dla każdego wiersza w test.csv oblicz liczbę znaków diakrytycznych w tekście. Za znaki diakrytyczne uważa się: ă, â, î, ș, ț (oraz ich wielkie litery Ă, Â, Î, Ș, Ț).
Zbuduj model zdolny do poprawnej klasyfikacji tekstów z pliku testowego do jednej z 3 klas.
Ewaluacja odbywa się poprzez dokładne sprawdzenie odpowiedzi. Poprawna odpowiedź = maksymalna liczba punktów, błędna odpowiedź = 0 punktów.
Ewaluacja odbywa się na podstawie metryki accuracy — proporcji poprawnych odpowiedzi do wszystkich. Punktacja jest proporcjonalna: accuracy 1.0 = 10 punktów, accuracy 0.0 = 0 punktów.
Ewaluacja odbywa się przy użyciu metryki F1-Macro.
Plik zgłoszeniowy musi być w formacie CSV i zawierać następujące kolumny:
1.ID w pliku test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...Uwaga: Rozwiązanie tego problemu nie wymaga użycia architektur typu Transformer (np. RoBERTa).