Težina
Vaš najbolji rezultat
N/D
Vaša tvrtka želi zaštititi korisnike od neželjenih e-mailova (spam).
Za to je odlučeno izgraditi automatizirani sustav koji će identificirati
spam e-mailove i odvojiti ih od legitimnih (nonspam).
Dobili ste skup označenih e-mailova i trebate izgraditi model
koji može klasificirati nove e-mailove.
Na raspolaganju su vam dvije datoteke:
label (spam = 1 / nonspam = 0)Glavni cilj: predviđanje vjerojatnosti da je e-mail spam (vrijednost između 0 i 1, gdje je 0 = sigurno nonspam, 1 = sigurno spam).
Svaki red predstavlja e-mail, s sljedećim atributima:
sample_id - jedinstveni identifikatortext - sadržaj e-mailalabel - samo u train.csv, 1 (spam)/ 0 (nonspam)Konačni cilj: predvidjeti label za redove iz test.csv.
Prva dva podzadatka provjeravaju jednostavnu analizu e-mailova.
Zadnji podzadatak evaluira model klasifikacije.
Odredite duljinu svakog e-maila kao broj znakova.
Prikažite za ovaj podzadatak cijeli broj.
Prebrojite koliko pojavljivanja riječi free postoji u e-mailu.
Izgradite model klasifikacije koji predviđa vjerojatnost da je e-mail spam (p ∈ [0,1]) za svaki red iz test.
Evaluacija se vrši koristeći ROC krivulju i AUC (Area Under the ROC Curve).
Podzadaci 1–2 se evaluiraju točno (usporedbom).
Datoteka submission.csv mora sadržavati 3 linije za svaki red iz test,
koje odgovaraju 3 podzadatka.
Struktura:
subtaskID, datapointID, answergdje je:
sample_idfree (cijeli broj)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Za Podzadatak 3, evaluacija se vrši koristeći ROC AUC (Area Under the ROC Curve).
To je jedinstvena mjera koja sintetizira performanse klasifikatora za sve moguće pragove odlučivanja.

