Trudność
Twój najlepszy wynik
Nie dotyczy
Twoja firma chce chronić użytkowników przed niechcianymi e-mailami (spam).
W tym celu postanowiono zbudować automatyczny system, który będzie identyfikował
e-maile spam i oddzielał je od legalnych (nonspam).
Otrzymałeś zbiór oznaczonych e-maili i musisz zbudować model
który będzie mógł klasyfikować nowe e-maile.
Udostępniono Ci dwa pliki:
label (spam = 1 / nonspam = 0)Główny cel: predykcja prawdopodobieństwa, że e-mail jest spamem (wartość między 0 a 1, gdzie 0 = pewny nonspam, 1 = pewny spam).
Każdy wiersz reprezentuje e-mail z następującymi atrybutami:
sample_id - unikalny identyfikatortext - zawartość e-mailalabel - tylko w train.csv, 1 (spam)/ 0 (nonspam)Końcowy cel: przewidzieć label dla wierszy z test.csv.
Pierwsze dwa podzadania sprawdzają prostą analizę e-maili.
Ostatni podzadanie ocenia model klasyfikacji.
Określ długość każdego e-maila jako liczbę znaków.
Wyświetl dla tego podzadania liczbę całkowitą.
Policz ile wystąpień słowa free znajduje się w e-mailu.
Zbuduj model klasyfikacji, który przewiduje prawdopodobieństwo, że e-mail jest spamem (p ∈ [0,1]) dla każdego wiersza z testu.
Ocena odbywa się przy użyciu krzywej ROC i AUC (Area Under the ROC Curve).
Podzadania 1–2 są oceniane dokładnie (przez porównanie).
Plik submission.csv musi zawierać 3 linie dla każdego wiersza z testu,
odpowiadające 3 podzadaniom.
Struktura:
subtaskID, datapointID, answergdzie:
sample_idfree (liczba całkowita)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742Dla Podzadania 3, ocena odbywa się przy użyciu ROC AUC (Area Under the ROC Curve).
Jest to unikalna miara, która syntetyzuje wydajność klasyfikatora dla wszystkich możliwych progów decyzyjnych.

