Problem #29
Författare:Mihai Nan
Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Målet är att bygga en textklassificeringsmodell som tilldelar varje nyhet en av de tre tematiska kategorierna:
WELLNESSENTERTAINMENTPOLITICSModellen ska lära sig baserat på träningstext och förutsäga etiketten (label) för nya texter.
Detta är ett problem med multi-klass klassificering (multi-class classification).
train.csvInnehåller texten och motsvarande kategori (etikett).
Varje rad representerar en nyhet.
| SampleID | text | label |
|---|---|---|
| 139768 | Take a Presence Power Break (The New Coffee Break) As soon as you honor the present moment... | WELLNESS |
| 297 | Yolanda Hadid Returns To Social Media After 9-Month Break For Depression, Lyme Relapse... | ENTERTAINMENT |
| 2274 | Democrats Want Paid Sick Days, Breaks For Domestic Workers... | POLITICS |
test.csvInnehåller endast texterna för vilka förutsägelser ska göras.
| SampleID | text |
|---|---|
| 106057 | Taylor Swift Calls Out Sexist Critics Again |
Utdatafilen ska heta submission.csv och innehålla två kolumner:
SampleID — textens unika identifierarelabel — kategorin som förutsagts av modellen (WELLNESS, ENTERTAINMENT eller POLITICS)Exempel:
| SampleID | label |
|---|---|
| 106057 | ENTERTAINMENT |
| 297 | ENTERTAINMENT |
| 2274 | POLITICS |
Modellernas prestanda kommer att mätas med macro F1-score, ett balanserat mått för multi-klass klassificering:
där:
Den slutliga poängen beräknas som aritmetiskt medelvärde av F1-poängen för alla klasser.
Datasetet är härlett från en samling nyheter med olika teman (välbefinnande, underhållning, politik), som kommer från offentliga mediaplattformar.