Задатак #29
Аутор:Mihai Nan
Тежина
Твој најбољи резултат
Н/Д
Želi se izgradnja modela za klasifikaciju teksta koji će svakoj vesti dodeliti jednu od tri tematske kategorije:
WELLNESSENTERTAINMENTPOLITICSModel treba da uči na osnovu tekstova za obuku i da predvidi etiketu (label) za nove tekstove.
Ovo je problem multi-klasa klasifikacije (multi-class classification).
train.csvSadrži tekst i odgovarajuću kategoriju (etiketu).
Svaki red predstavlja jednu vest.
| SampleID | text | label |
|---|---|---|
| 139768 | Take a Presence Power Break (The New Coffee Break) As soon as you honor the present moment... | WELLNESS |
| 297 | Yolanda Hadid Returns To Social Media After 9-Month Break For Depression, Lyme Relapse... | ENTERTAINMENT |
| 2274 | Democrats Want Paid Sick Days, Breaks For Domestic Workers... | POLITICS |
test.csvSadrži samo tekstove za koje treba napraviti predikciju.
| SampleID | text |
|---|---|
| 106057 | Taylor Swift Calls Out Sexist Critics Again |
Izlazni fajl treba da se zove submission.csv i da sadrži dve kolone:
SampleID — jedinstveni identifikator tekstalabel — kategorija predviđena od strane modela (WELLNESS, ENTERTAINMENT ili POLITICS)Primer:
| SampleID | label |
|---|---|
| 106057 | ENTERTAINMENT |
| 297 | ENTERTAINMENT |
| 2274 | POLITICS |
Performanse modela će biti merene koristeći macro F1-score, uravnoteženu metriku za multi-klasa klasifikaciju:
gde je:
Finalni skor se računa kao aritmetička sredina F1-score-ova za sve klase.
Dataset je izveden iz kolekcije vesti sa različitim temama (blagostanje, zabava, politika), koje potiču sa javnih medijskih platformi.