Moeilijkheid
Jouw beste score
N.v.t.
Je bedrijf wil gebruikers beschermen tegen ongewenste e-mails (spam).
Hiervoor is besloten om een automatisch systeem te bouwen dat
spam e-mails identificeert en deze scheidt van legitieme (nonspam) e-mails.
Je hebt een set gelabelde e-mails ontvangen en moet een model bouwen
dat nieuwe e-mails kan classificeren.
Er zijn twee bestanden ter beschikking gesteld:
label (spam = 1 / nonspam = 0)Hoofddoel: voorspelling van de waarschijnlijkheid dat een e-mail spam is (waarde tussen 0 en 1, waarbij 0 = zeker nonspam, 1 = zeker spam).
Elke rij vertegenwoordigt een e-mail, met de volgende attributen:
sample_id - unieke identificatortext - inhoud van de e-maillabel - alleen in train.csv, 1 (spam)/ 0 (nonspam)Einddoel: voorspel label voor de rijen in test.csv.
De eerste twee subtaken controleren eenvoudige analyse van e-mails.
De laatste subtaak evalueert het classificatiemodel.
Bepaal de lengte van elke e-mail als aantal karakters.
Toon voor deze subtaak een geheel getal.
Tel hoeveel keer het woord free voorkomt in de e-mail.
Bouw een classificatiemodel dat de waarschijnlijkheid voorspelt dat een e-mail spam is (p ∈ [0,1]) voor elke rij in test.
De evaluatie gebeurt met behulp van ROC curve en AUC (Area Under the ROC Curve).
Subtaken 1–2 worden exact geëvalueerd (door vergelijking).
Het bestand submission.csv moet 3 regels bevatten voor elke rij in test,
overeenkomend met de 3 subtaken.
Structuur:
subtaskID, datapointID, answerwaarbij:
sample_idfree voorkomt (geheel getal)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Voor Subtaak 3 gebeurt de evaluatie met behulp van ROC AUC (Area Under the ROC Curve).
Dit is een unieke maat die de prestatie van een classificator samenvat voor alle mogelijke beslissingsdrempels.

