Vanskelighetsgrad
Din beste poengsum
N/A
Selskapet ditt ønsker å beskytte brukerne mot uønskede e-poster (spam).
For dette har man besluttet å bygge et automatisk system som skal identifisere
spam-e-poster og skille dem fra legitime (ikke-spam).
Du har mottatt et sett med merkede e-poster og må bygge en modell
som kan klassifisere nye e-poster.
Du har fått tilgang til to filer:
label (spam = 1 / nonspam = 0)Hovedmål: prediksjon av sannsynligheten for at en e-post er spam (verdi mellom 0 og 1, hvor 0 = sikker ikke-spam, 1 = sikker spam).
Hver rad representerer en e-post, med følgende attributter:
sample_id - unik identifikatortext - innholdet i e-postenlabel - kun i train.csv, 1 (spam)/ 0 (ikke-spam)Endelig mål: prediker label for radene i test.csv.
De to første deloppgavene verifiserer enkel analyse av e-postene.
Den siste deloppgaven evaluerer klassifikasjonsmodellen.
Bestem lengden på hver e-post som antall tegn.
Vis for denne deloppgaven et heltall.
Tell hvor mange forekomster av ordet free som finnes i e-posten.
Bygg en klassifikasjonsmodell som predikerer sannsynligheten for at en e-post er spam (p ∈ [0,1]) for hver rad i test.
Evalueringen gjøres ved bruk av ROC-kurve og AUC (Area Under the ROC Curve).
Deloppgave 1–2 evalueres nøyaktig (ved sammenligning).
Filen submission.csv må inneholde 3 linjer for hver rad i test,
tilsvarende de 3 deloppgavene.
Struktur:
subtaskID, datapointID, answerhvor:
sample_idfree (heltall)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742For Deloppgave 3 gjøres evalueringen ved bruk av ROC AUC (Area Under the ROC Curve).
Dette er et unikt mål som sammenfatter ytelsen til en klassifikator for alle mulige beslutningsgrenser.

