Dificultad
Tu mejor puntuación
N/D
Tu empresa desea proteger a los usuarios de emails no deseados (spam).
Para esto, se ha decidido construir un sistema automático que identifique
los emails spam y los separe de los legítimos (nonspam).
Has recibido un conjunto de emails etiquetados y debes construir un modelo
que pueda clasificar emails nuevos.
Se han puesto a tu disposición dos archivos:
label (spam = 1 / nonspam = 0)Objetivo principal: predicción de la probabilidad de que un email sea spam (valor entre 0 y 1, donde 0 = nonspam seguro, 1 = spam seguro).
Cada fila representa un email, con los siguientes atributos:
sample_id - identificador únicotext - contenido del emaillabel - solo en train.csv, 1 (spam)/ 0 (nonspam)Objetivo final: predecir label para las filas de test.csv.
Las primeras dos subtareas verifican el análisis simple de los emails.
La última subtarea evalúa el modelo de clasificación.
Determina la longitud de cada email como número de caracteres.
Muestra para esta subtarea un número entero.
Cuenta cuántas apariciones de la palabra free existen en el email.
Construye un modelo de clasificación que prediga la probabilidad de que un email sea spam (p ∈ [0,1]) para cada fila del test.
La evaluación se realiza usando curva ROC y AUC (Area Under the ROC Curve).
Las subtareas 1–2 se evalúan exactamente (por comparación).
El archivo submission.csv debe contener 3 líneas para cada fila del test,
correspondientes a las 3 subtareas.
Estructura:
subtaskID, datapointID, answerdonde:
sample_idfree (número entero)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Para la Subtarea 3, la evaluación se realiza usando ROC AUC (Area Under the ROC Curve).
Esta es una medida única que sintetiza el rendimiento de un clasificador para todos los umbrales de decisión posibles.

