Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Jūsu uzņēmums vēlas aizsargāt lietotājus no nevēlamiem e-pastiem (surogātpasts).
Šim nolūkam ir nolemts izveidot automātisku sistēmu, kas identificē
surogātpasta e-pastus un atdala tos no likumīgajiem (ne-surogātpasts).
Jūs esat saņēmis marķētu e-pastu kopu un jums ir jāizveido modelis,
kas spētu klasificēt jaunus e-pastus.
Jūsu rīcībā ir nodoti divi faili:
label (spam = 1 / nonspam = 0)Galvenais mērķis: e-pasta surogātpasta varbūtības prognozēšana (vērtība starp 0 un 1, kur 0 = droši ne-surogātpasts, 1 = droši surogātpasts).
Katra rinda pārstāv e-pastu ar šādiem atribūtiem:
sample_id - unikāls identifikatorstext - e-pasta saturslabel - tikai train.csv, 1 (surogātpasts)/ 0 (ne-surogātpasts)Galīgais mērķis: prognozēt label rindām no test.csv.
Pirmie divi apakšuzdevumi pārbauda vienkāršu e-pastu analīzi.
Pēdējais apakšuzdevums novērtē klasifikācijas modeli.
Noteikt katra e-pasta garumu kā rakstzīmju skaitu.
Šim apakšuzdevumam attēlojiet veselu skaitli.
Saskaitīt, cik reižu vārds free parādās e-pastā.
Izveidojiet klasifikācijas modeli, kas prognozē varbūtību, ka e-pasts ir surogātpasts (p ∈ [0,1]) katrai rindai no testa.
Novērtēšana tiek veikta, izmantojot ROC līkni un AUC (Area Under the ROC Curve).
Apakšuzdevumi 1–2 tiek novērtēti precīzi (salīdzinot).
Failam submission.csv jāsatur 3 rindas katrai testa rindai,
kas atbilst 3 apakšuzdevumiem.
Struktūra:
subtaskID, datapointID, answerkur:
sample_id vērtībafree parādīšanās reižu skaits (vesels skaitlis)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Apakšuzdevumam 3 novērtēšana tiek veikta, izmantojot ROC AUC (Area Under the ROC Curve).
Šī ir vienota mērvienība, kas apkopo klasifikatora veiktspēju visiem iespējamiem lēmumu sliekšņiem.

