Raskusaste
Sinu parim tulemus
Puudub
Teie ettevõte soovib kaitsta kasutajaid soovimatute e-kirjade (rämpsposti) eest.
Selleks on otsustatud ehitada automaatne süsteem, mis tuvastaks
rämpsposti e-kirjad ja eraldaks need õiguspärastest (mitterämpsposti) e-kirjadest.
Olete saanud märgistatud e-kirjade komplekti ja peate ehitama mudeli,
mis suudaks klassifitseerida uusi e-kirju.
Teile on antud kaks faili:
label (spam = 1 / nonspam = 0)Peamine eesmärk: e-kirja rämpsposti olemise tõenäosuse prognoosimine (väärtus vahemikus 0 ja 1, kus 0 = kindlasti mitterämpsposti, 1 = kindlasti rämpsposti).
Iga rida esindab e-kirja järgmiste atribuutidega:
sample_id - unikaalne identifikaatortext - e-kirja sisulabel - ainult train.csv-s, 1 (rämpsposti)/ 0 (mitterämpsposti)Lõppeesmärk: ennustage label test.csv ridadele.
Esimesed kaks alamülesannet kontrollivad e-kirjade lihtsat analüüsi.
Viimane alamülesanne hindab klassifitseerimismudelit.
Määrake iga e-kirja pikkus märkide arvuna.
Kuvage selle alamülesande jaoks täisarv.
Loendage, mitu korda esineb e-kirjas sõna free.
Ehitage klassifitseerimismudel, mis ennustab tõenäosust, et e-kiri on rämpsposti (p ∈ [0,1]) iga testi rea jaoks.
Hindamine toimub kasutades ROC kõverat ja AUC (Area Under the ROC Curve).
Alamülesandeid 1–2 hinnatakse täpselt (võrdlemise teel).
Fail submission.csv peab sisaldama 3 rida iga testi rea kohta,
mis vastavad 3 alamülesandele.
Struktuur:
subtaskID, datapointID, answerkus:
sample_id väärtusfree esinemiste arv (täisarv)sample_id = 00042 jaoks:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Alamülesande 3 puhul toimub hindamine kasutades ROC AUC (Area Under the ROC Curve).
See on ühene mõõdik, mis võtab kokku klassifitseerija jõudluse kõigi võimalike otsustuslävendite jaoks.

