Difficoltà
Il tuo miglior punteggio
N/D
La tua azienda desidera proteggere gli utenti dalle email indesiderate (spam).
Per questo, si è deciso di costruire un sistema automatico che identifichi
le email spam e le separi da quelle legittime (nonspam).
Hai ricevuto un set di email etichettate e devi costruire un modello
che possa classificare le nuove email.
Ti sono stati messi a disposizione due file:
label (spam = 1 / nonspam = 0)Obiettivo principale: predizione della probabilità che un'email sia spam (valore tra 0 e 1, dove 0 = nonspam sicuro, 1 = spam sicuro).
Ogni riga rappresenta un'email, con i seguenti attributi:
sample_id - identificatore unicotext - contenuto dell'emaillabel - solo in train.csv, 1 (spam)/ 0 (nonspam)Obiettivo finale: predire label per le righe in test.csv.
I primi due subtask verificano l'analisi semplice delle email.
L'ultimo subtask valuta il modello di classificazione.
Determina la lunghezza di ogni email come numero di caratteri.
Visualizza per questo subtask un numero intero.
Conta quante occorrenze della parola free esistono nell'email.
Costruisci un modello di classificazione che predica la probabilità che un'email sia spam (p ∈ [0,1]) per ogni riga del test.
La valutazione si fa usando curva ROC e AUC (Area Under the ROC Curve).
I subtask 1–2 si valutano esattamente (per confronto).
Il file submission.csv deve contenere 3 righe per ogni riga del test,
corrispondenti ai 3 subtask.
Struttura:
subtaskID, datapointID, answerdove:
sample_idfree (numero intero)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Per il Subtask 3, la valutazione si fa usando ROC AUC (Area Under the ROC Curve).
Questa è una misura unica che sintetizza le prestazioni di un classificatore per tutte le soglie di decisione possibili.

