Difficulté
Votre meilleur score
N/D
Votre entreprise souhaite protéger les utilisateurs des emails indésirables (spam).
Pour cela, il a été décidé de construire un système automatique qui identifie
les emails spam et les sépare de ceux légitimes (nonspam).
Vous avez reçu un ensemble d'emails étiquetés et devez construire un modèle
qui puisse classifier les nouveaux emails.
Deux fichiers ont été mis à votre disposition :
label (spam = 1 / nonspam = 0)Objectif principal : prédiction de la probabilité qu'un email soit spam (valeur entre 0 et 1, où 0 = nonspam certain, 1 = spam certain).
Chaque ligne représente un email, avec les attributs suivants :
sample_id - identifiant uniquetext - contenu de l'emaillabel - uniquement dans train.csv, 1 (spam)/ 0 (nonspam)Objectif final : prédire label pour les lignes de test.csv.
Les deux premières sous-tâches vérifient l'analyse simple des emails.
La dernière sous-tâche évalue le modèle de classification.
Déterminez la longueur de chaque email en nombre de caractères.
Affichez pour cette sous-tâche un nombre entier.
Comptez combien d'occurrences du mot free existent dans l'email.
Construisez un modèle de classification qui prédit la probabilité qu'un email soit spam (p ∈ [0,1]) pour chaque ligne du test.
L'évaluation se fait en utilisant ROC curve et AUC (Area Under the ROC Curve).
Les sous-tâches 1–2 sont évaluées exactement (par comparaison).
Le fichier submission.csv doit contenir 3 lignes pour chaque ligne du test,
correspondant aux 3 sous-tâches.
Structure :
subtaskID, datapointID, answeroù :
sample_idfree (nombre entier)sample_id = 00042 :subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Pour la Sous-tâche 3, l'évaluation se fait en utilisant ROC AUC (Area Under the ROC Curve).
Il s'agit d'une mesure unique qui synthétise la performance d'un classificateur pour tous les seuils de décision possibles.

