Problema #64
Autor:Mihnea-Teodor Stoica🥈IOAI 2026 Silver Medalist
Dificuldade
A tua melhor pontuação
N/D
Num mundo paralelo das redes sociais, Chirper é a plataforma de micro-mensagens mais popular.
Recentemente, a plataforma foi comprada pelo famoso (e ligeiramente excêntrico) Melon Husk, que decidiu rebatizá-la com o nome de Y.
Para tornar Y mais limpo e mais amigável, Melon Husk pede à sua equipe de data science para construir um modelo de classificação que detecte automaticamente chirps problemáticos (spam, conteúdo irrelevante ou ruído), para que possam ser filtrados do feed.
Você recebeu um conjunto de chirps históricos e precisa construir um modelo
que possa classificar novos chirps.
Foram disponibilizados dois arquivos:
label (problematic = 1 / normal = 0)Objetivo principal: predição da probabilidade de um chirp ser problemático
(valor entre 0 e 1, onde 0 = chirp certamente normal, 1 = chirp certamente problemático).
Cada linha representa um chirp publicado no Chirper Y, com os seguintes atributos:
id – identificador único do chirpchirp – texto do chirplabel – apenas em train.csv, 1 (problemático) / 0 (normal)Objetivo final: prever label para as linhas em test.csv.
As duas primeiras subtarefas verificam análise simples dos chirps.
A última subtarefa avalia o desempenho do modelo de classificação.
Determine o comprimento de cada chirp como número de caracteres.
Exiba para esta subtarefa um número inteiro.
Conte quantas ocorrências do caractere # existem no chirp
(indicador importante para hashtags excessivas, adoradas por spammers 😄).
Construa um modelo de classificação que preveja a probabilidade de um chirp
ser problemático (p ∈ [0,1]) para cada linha do teste.
A avaliação é feita usando curva ROC e AUC (Area Under the ROC Curve).
Subtarefas 1–2 são avaliadas exatamente (por comparação).
O arquivo submission.csv deve conter 3 linhas para cada linha do teste,
correspondentes às 3 subtarefas.
Estrutura:
subtaskID,datapointID,answeronde:
id# (número inteiro)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083Para Subtarefa 3, a avaliação é feita usando ROC AUC (Area Under the ROC Curve).
Esta é uma medida única que sintetiza o desempenho de um classificador
para todos os limiares de decisão possíveis.
Traça-se a curva ROC, que representa:
A área sob a curva (AUC) é calculada usando a regra dos trapézios:
Interpretação da pontuação: