Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Ditt företag vill skydda användarna från oönskade mejl (spam).
För detta har man beslutat att bygga ett automatiskt system som ska identifiera
spam-mejl och separera dem från legitima mejl (nonspam).
Du har fått en uppsättning märkta mejl och behöver bygga en modell
som kan klassificera nya mejl.
Du har fått tillgång till två filer:
label (spam = 1 / nonspam = 0)Huvudsyfte: förutsägelse av sannolikheten att ett mejl är spam (värde mellan 0 och 1, där 0 = säkert nonspam, 1 = säkert spam).
Varje rad representerar ett mejl, med följande attribut:
sample_id - unik identifieraretext - mejlets innehålllabel - endast i train.csv, 1 (spam)/ 0 (nonspam)Slutmål: förutsäg label för raderna i test.csv.
De första två deluppgifterna kontrollerar enkel analys av mejlen.
Den sista deluppgiften utvärderar klassificeringsmodellen.
Bestäm längden på varje mejl som antal tecken.
Visa för denna deluppgift ett heltal.
Räkna hur många förekomster av ordet free som finns i mejlet.
Bygg en klassificeringsmodell som förutsäger sannolikheten att ett mejl är spam (p ∈ [0,1]) för varje rad i test.
Utvärderingen görs med ROC curve och AUC (Area Under the ROC Curve).
Deluppgifter 1–2 utvärderas exakt (genom jämförelse).
Filen submission.csv ska innehålla 3 rader för varje rad i test,
motsvarande de 3 deluppgifterna.
Struktur:
subtaskID, datapointID, answerdär:
sample_idfree (heltal)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742För Deluppgift 3 görs utvärderingen med ROC AUC (Area Under the ROC Curve).
Detta är ett unikt mått som sammanfattar en klassificerares prestanda för alla möjliga beslutströsklar.

