Dificuldade
A tua melhor pontuação
N/D
Sua empresa deseja proteger os usuários de emails indesejados (spam).
Para isso, foi decidida a construção de um sistema automático que identifique
emails spam e os separe dos legítimos (nonspam).
Você recebeu um conjunto de emails rotulados e precisa construir um modelo
que possa classificar novos emails.
Foram disponibilizados dois arquivos:
label (spam = 1 / nonspam = 0)Objetivo principal: predição da probabilidade de um email ser spam (valor entre 0 e 1, onde 0 = nonspam certo, 1 = spam certo).
Cada linha representa um email, com os seguintes atributos:
sample_id - identificador únicotext - conteúdo do emaillabel - apenas em train.csv, 1 (spam)/ 0 (nonspam)Objetivo final: predizer label para as linhas de test.csv.
As duas primeiras subtarefas verificam a análise simples dos emails.
A última subtarefa avalia o modelo de classificação.
Determine o comprimento de cada email como número de caracteres.
Exiba para esta subtarefa um número inteiro.
Conte quantas ocorrências da palavra free existem no email.
Construa um modelo de classificação que prediga a probabilidade de um email ser spam (p ∈ [0,1]) para cada linha do teste.
A avaliação é feita usando curva ROC e AUC (Area Under the ROC Curve).
Subtarefas 1–2 são avaliadas exatamente (por comparação).
O arquivo submission.csv deve conter 3 linhas para cada linha do teste,
correspondentes às 3 subtarefas.
Estrutura:
subtaskID, datapointID, answeronde:
sample_idfree (número inteiro)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Para a Subtarefa 3, a avaliação é feita usando ROC AUC (Area Under the ROC Curve).
Esta é uma medida única que sintetiza o desempenho de um classificador para todos os limiares de decisão possíveis.

