Úloha #29
Autor:Mihai Nan
Obtiažnosť
Vaše najlepšie skóre
N/A
Cieľom je vybudovanie modelu klasifikácie textu, ktorý priradí každej správe jednu z troch tematických kategórií:
WELLNESSENTERTAINMENTPOLITICSModel musí sa učiť na základe trénovacích textov a predpovedať etiketu (label) pre nové texty.
Toto je problém viactriednej klasifikácie (multi-class classification).
train.csvObsahuje text a príslušnú kategóriu (etiketu).
Každý riadok predstavuje jednu správu.
| SampleID | text | label |
|---|---|---|
| 139768 | Take a Presence Power Break (The New Coffee Break) As soon as you honor the present moment... | WELLNESS |
| 297 | Yolanda Hadid Returns To Social Media After 9-Month Break For Depression, Lyme Relapse... | ENTERTAINMENT |
| 2274 | Democrats Want Paid Sick Days, Breaks For Domestic Workers... | POLITICS |
test.csvObsahuje iba texty, pre ktoré treba urobiť predikciu.
| SampleID | text |
|---|---|
| 106057 | Taylor Swift Calls Out Sexist Critics Again |
Výstupný súbor sa musí volať submission.csv a musí obsahovať dva stĺpce:
SampleID — jedinečný identifikátor textulabel — kategória predpovedaná modelom (WELLNESS, ENTERTAINMENT alebo POLITICS)Príklad:
| SampleID | label |
|---|---|
| 106057 | ENTERTAINMENT |
| 297 | ENTERTAINMENT |
| 2274 | POLITICS |
Výkonnosť modelov bude meraná pomocou macro F1-score, vyváženej metriky pre viactriednu klasifikáciu:
kde:
Finálne skóre sa vypočíta ako aritmetický priemer F1-score pre všetky triedy.
Dataset je odvodený z kolekcie správ s rôznymi témami (wellness, zábava, politika), pochádzajúcich z verejných mediálnych platforiem.