Težavnost
Vaš najboljši rezultat
N/A
Vaše podjetje želi zaščititi uporabnike pred neželeno e-pošto (spam).
Za to se je odločilo za izgradnjo avtomatskega sistema, ki bo identificiral
spam e-poštna sporočila in jih ločil od legitimnih (nonspam).
Prejeli ste nabor označenih e-poštnih sporočil in morate zgraditi model,
ki bo lahko klasificiral nova e-poštna sporočila.
Na voljo imate dve datoteki:
label (spam = 1 / nonspam = 0)Glavni cilj: napoved verjetnosti, da je e-poštno sporočilo spam (vrednost med 0 in 1, kjer 0 = zagotovo nonspam, 1 = zagotovo spam).
Vsaka vrstica predstavlja e-poštno sporočilo z naslednjimi atributi:
sample_id - edinstveni identifikatortext - vsebina e-poštnega sporočilalabel - samo v train.csv, 1 (spam)/ 0 (nonspam)Končni cilj: napovedati label za vrstice v test.csv.
Prvi dve podnalogi preverjata preprosto analizo e-poštnih sporočil.
Zadnja podnaloga ocenjuje klasifikacijski model.
Določite dolžino vsakega e-poštnega sporočila kot število znakov.
Za to podnalogo prikažite celo število.
Preštejte, koliko pojavitev besede free obstaja v e-poštnem sporočilu.
Zgradite klasifikacijski model, ki napoveduje verjetnost, da je e-poštno sporočilo spam (p ∈ [0,1]) za vsako vrstico v testu.
Ocenjevanje se izvaja z uporabo ROC krivulje in AUC (Area Under the ROC Curve).
Podnalogi 1–2 se ocenjujeta natančno (s primerjavo).
Datoteka submission.csv mora vsebovati 3 vrstice za vsako vrstico v testu,
ki ustrezajo 3 podnalogam.
Struktura:
subtaskID, datapointID, answerkjer:
sample_idfree (celo število)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Za Podnalogo 3 se ocenjevanje izvaja z uporabo ROC AUC (Area Under the ROC Curve).
To je edinstvena mera, ki povzema učinkovitost klasifikatorja za vse možne pragove odločitve.

