Sværhedsgrad
Din bedste score
N/A
Dit firma ønsker at beskytte brugerne mod uønskede e-mails (spam).
Til dette formål er det besluttet at bygge et automatisk system, der kan identificere
spam-e-mails og adskille dem fra legitime (nonspam).
Du har modtaget et sæt mærkede e-mails og skal bygge en model,
der kan klassificere nye e-mails.
Du har fået stillet to filer til rådighed:
label (spam = 1 / nonspam = 0)Hovedformålet: forudsigelse af sandsynligheden for at en e-mail er spam (værdi mellem 0 og 1, hvor 0 = sikker nonspam, 1 = sikker spam).
Hver række repræsenterer en e-mail med følgende attributter:
sample_id - unikt identifikatortext - e-mailens indholdlabel - kun i train.csv, 1 (spam)/ 0 (nonspam)Endeligt mål: forudsig label for rækkerne i test.csv.
De første to subtasks verificerer simpel analyse af e-mails.
Det sidste subtask evaluerer klassificeringsmodellen.
Bestem længden af hver e-mail som antal tegn.
Vis for dette subtask et heltal.
Tæl hvor mange forekomster af ordet free der findes i e-mailen.
Byg en klassificeringsmodel, der forudsiger sandsynligheden for at en e-mail er spam (p ∈ [0,1]) for hver række i test.
Evalueringen sker ved hjælp af ROC curve og AUC (Area Under the ROC Curve).
Subtasks 1–2 evalueres nøjagtigt (ved sammenligning).
Filen submission.csv skal indeholde 3 linjer for hver række i test,
svarende til de 3 subtasks.
Struktur:
subtaskID, datapointID, answerhvor:
sample_idfree (heltal)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742For Subtask 3 sker evalueringen ved hjælp af ROC AUC (Area Under the ROC Curve).
Dette er et unikt mål, der sammenfatter en klassifikators ydeevne for alle mulige beslutningsgrænser.

