Problema #64
Autor:Mihnea-Teodor Stoica🥈IOAI 2026 Silver Medalist
Dificultad
Tu mejor puntuación
N/D
En un mundo paralelo de las redes sociales, Chirper es la plataforma de micro-mensajes más popular.
Recientemente, la plataforma fue comprada por el célebre (y ligeramente excéntrico) Melon Husk, quien decidió rebrandearla bajo el nombre de Y.
Para hacer Y más limpia y amigable, Melon Husk pide a tu equipo de data science que construya un modelo de clasificación que detecte automáticamente chirp-s problemáticos (spam, contenido irrelevante o ruido), para que puedan ser filtrados del feed.
Has recibido un conjunto de chirp-s históricos y debes construir un modelo
que pueda clasificar chirp-s nuevos.
Se han puesto a tu disposición dos archivos:
label (problematic = 1 / normal = 0)Objetivo principal: predicción de la probabilidad de que un chirp sea problemático
(valor entre 0 y 1, donde 0 = chirp seguramente normal, 1 = chirp seguramente problemático).
Cada fila representa un chirp publicado en Chirper Y, con los siguientes atributos:
id – identificador único del chirpchirp – el texto del chirplabel – solo en train.csv, 1 (problemático) / 0 (normal)Objetivo final: predecir label para las filas en test.csv.
Las primeras dos subtareas verifican el análisis simple de los chirp-s.
La última subtarea evalúa el rendimiento del modelo de clasificación.
Determina la longitud de cada chirp como número de caracteres.
Muestra para esta subtarea un número entero.
Cuenta cuántas apariciones del carácter # existen en el chirp
(indicador importante para hashtags excesivos, amados por los spammers 😄).
Construye un modelo de clasificación que prediga la probabilidad de que un chirp
sea problemático (p ∈ [0,1]) para cada fila en test.
La evaluación se hace usando curva ROC y AUC (Area Under the ROC Curve).
Las subtareas 1–2 se evalúan exactamente (por comparación).
El archivo submission.csv debe contener 3 líneas para cada fila en test,
correspondientes a las 3 subtareas.
Estructura:
subtaskID,datapointID,answerdonde:
donde:
id# (número entero)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083Para la Subtarea 3, la evaluación se hace usando ROC AUC (Area Under the ROC Curve).
Esta es una medida única que sintetiza el rendimiento de un clasificador
para todos los umbrales de decisión posibles.
Se traza la curva ROC, que representa:
El área bajo la curva (AUC) se calcula usando la regla de los trapecios:
Interpretación del puntaje: