Тежина
Твој најбољи резултат
Н/Д
Vaša kompanija želi da zaštiti korisnike od neželjenih email-ova (spam).
Za to je odlučeno da se izgradi automatski sistem koji će identifikovati
spam email-ove i odvojiti ih od legitimnih (nonspam).
Dobili ste skup označenih email-ova i trebate da izgradite model
koji može da klasifikuje nove email-ove.
Na raspolaganju su vam dva fajla:
label (spam = 1 / nonspam = 0)Glavni cilj: predikcija verovatnoće da je email spam (vrednost između 0 i 1, gde je 0 = sigurno nonspam, 1 = sigurno spam).
Svaki red predstavlja email, sa sledećim atributima:
sample_id - jedinstveni identifikatortext - sadržaj email-alabel - samo u train.csv, 1 (spam)/ 0 (nonspam)Krajnji cilj: predvideti label za redove iz test.csv.
Prva dva podzadatka proveravaju jednostavnu analizu email-ova.
Poslednji podzadatak evaluira model klasifikacije.
Odredite dužinu svakog email-a kao broj karaktera.
Prikažite za ovaj podzadatak ceo broj.
Prebrojite koliko pojavljivanja reči free postoji u email-u.
Izgradite model klasifikacije koji predviđa verovatnoću da je email spam (p ∈ [0,1]) za svaki red iz test-a.
Evaluacija se vrši koristeći ROC krivu i AUC (Area Under the ROC Curve).
Podzadaci 1–2 se evaluiraju tačno (poređenjem).
Fajl submission.csv treba da sadrži po 3 linije za svaki red iz test-a,
koje odgovaraju 3 podzadatka.
Struktura:
subtaskID, datapointID, answergde je:
sample_idfree (ceo broj)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Za Podzadatak 3, evaluacija se vrši koristeći ROC AUC (Area Under the ROC Curve).
Ovo je jedinstvena mera koja sintetiše performanse klasifikatora za sve moguće pragove odlučivanja.

