Obtížnost
Vaše nejlepší skóre
N/A
Vaše společnost si přeje chránit uživatele před nechtěnými emaily (spam).
Za tímto účelem se rozhodla vybudovat automatický systém, který by identifikoval
spamové emaily a oddělil je od legitimních (nonspam).
Obdrželi jste sadu označených emailů a musíte vybudovat model,
který dokáže klasifikovat nové emaily.
K dispozici máte dva soubory:
label (spam = 1 / nonspam = 0)Hlavní cíl: predikce pravděpodobnosti, že email je spam (hodnota mezi 0 a 1, kde 0 = určitě nonspam, 1 = určitě spam).
Každý řádek představuje email s následujícími atributy:
sample_id - jedinečný identifikátortext - obsah emailulabel - pouze v train.csv, 1 (spam)/ 0 (nonspam)Konečný cíl: predikovat label pro řádky v test.csv.
První dva podúkoly ověřují jednoduchou analýzu emailů.
Poslední podúkol hodnotí klasifikační model.
Určete délku každého emailu jako počet znaků.
Pro tento podúkol zobrazte celé číslo.
Spočítejte, kolik výskytů slova free se nachází v emailu.
Vybudujte klasifikační model, který predikuje pravděpodobnost, že email je spam (p ∈ [0,1]) pro každý řádek z testu.
Hodnocení se provádí pomocí ROC křivky a AUC (Area Under the ROC Curve).
Podúkoly 1–2 se hodnotí přesně (porovnáním).
Soubor submission.csv musí obsahovat 3 řádky pro každý řádek z testu,
odpovídající 3 podúkolům.
Struktura:
subtaskID, datapointID, answerkde:
sample_idfree (celé číslo)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Pro Podúkol 3 se hodnocení provádí pomocí ROC AUC (Area Under the ROC Curve).
Jedná se o jedinečnou míru, která shrnuje výkonnost klasifikátoru pro všechny možné rozhodovací prahy.

