Problema #29
Autore:Mihai Nan
Difficoltà
Il tuo miglior punteggio
N/D
Si desidera costruire un modello di classificazione del testo che assegni a ciascuna notizia una delle tre categorie tematiche:
WELLNESSENTERTAINMENTPOLITICSIl modello deve apprendere sulla base dei testi di addestramento e predire l'etichetta (label) per i nuovi testi.
Questo è un problema di classificazione multi-classe (multi-class classification).
train.csvContiene il testo e la categoria (etichetta) corrispondente.
Ogni riga rappresenta una notizia.
| SampleID | text | label |
|---|---|---|
| 139768 | Take a Presence Power Break (The New Coffee Break) As soon as you honor the present moment... | WELLNESS |
| 297 | Yolanda Hadid Returns To Social Media After 9-Month Break For Depression, Lyme Relapse... | ENTERTAINMENT |
| 2274 | Democrats Want Paid Sick Days, Breaks For Domestic Workers... | POLITICS |
test.csvContiene solo i testi per i quali deve essere fatta la predizione.
| SampleID | text |
|---|---|
| 106057 | Taylor Swift Calls Out Sexist Critics Again |
Il file di output deve chiamarsi submission.csv e contenere due colonne:
SampleID — l'identificatore unico del testolabel — la categoria predetta dal modello (WELLNESS, ENTERTAINMENT o POLITICS)Esempio:
| SampleID | label |
|---|---|
| 106057 | ENTERTAINMENT |
| 297 | ENTERTAINMENT |
| 2274 | POLITICS |
Le prestazioni dei modelli saranno misurate utilizzando il macro F1-score, una metrica bilanciata per la classificazione multi-classe:
dove:
Il punteggio finale si calcola come media aritmetica degli F1-score per tutte le classi.
Il dataset è derivato da una collezione di notizie con temi diversi (benessere, intrattenimento, politica), provenienti da piattaforme mediatiche pubbliche.