Naloga #29
Avtor:Mihai Nan
Težavnost
Vaš najboljši rezultat
N/A
Želimo zgraditi model za klasifikacijo besedila, ki bo vsaki novici pripisal eno od treh tematskih kategorij:
WELLNESSENTERTAINMENTPOLITICSModel se mora naučiti na podlagi učnih besedil in napovedati etiketo (label) za nova besedila.
To je problem večrazredne klasifikacije (multi-class classification).
train.csvVsebuje besedilo in ustrezno kategorijo (etiketo).
Vsaka vrstica predstavlja novico.
| SampleID | text | label |
|---|---|---|
| 139768 | Take a Presence Power Break (The New Coffee Break) As soon as you honor the present moment... | WELLNESS |
| 297 | Yolanda Hadid Returns To Social Media After 9-Month Break For Depression, Lyme Relapse... | ENTERTAINMENT |
| 2274 | Democrats Want Paid Sick Days, Breaks For Domestic Workers... | POLITICS |
test.csvVsebuje samo besedila, za katera je treba narediti napoved.
| SampleID | text |
|---|---|
| 106057 | Taylor Swift Calls Out Sexist Critics Again |
Izhodna datoteka se mora imenovati submission.csv in mora vsebovati dva stolpca:
SampleID — edinstveni identifikator besedilalabel — kategorija, ki jo je napovedal model (WELLNESS, ENTERTAINMENT ali POLITICS)Primer:
| SampleID | label |
|---|---|
| 106057 | ENTERTAINMENT |
| 297 | ENTERTAINMENT |
| 2274 | POLITICS |
Uspešnost modelov bo merjena z uporabo macro F1-score, uravnotežene metrike za večrazredno klasifikacijo:
kjer je:
Končni rezultat se izračuna kot aritmetična sredina F1-score-ov za vse razrede.
Nabor podatkov je izveden iz zbirke novic z različnimi temami (dobro počutje, zabava, politika), ki izvirajo z javnih medijskih platform.