Trudność
Twój najlepszy wynik
Nie dotyczy
W równoległym świecie mediów społecznościowych Chirper jest najpopularniejszą platformą mikrowiadomości.
Niedawno platforma została kupiona przez słynnego (i lekko ekscentrycznego) Melona Huska, który postanowił przeprowadzić rebranding pod nazwą Y.
Aby uczynić Y czystszym i bardziej przyjaznym, Melon Husk prosi Twój zespół data science o zbudowanie modelu klasyfikacji, który automatycznie wykryje problematyczne chirp-y (spam, nieistotne treści lub szum), tak aby mogły zostać odfiltrowane z feed-a.
Otrzymałeś zestaw historycznych chirp-ów i musisz zbudować model
który będzie mógł klasyfikować nowe chirp-y.
Zostały Ci udostępnione dwa pliki:
label (problematic = 1 / normal = 0)Główny cel: predykcja prawdopodobieństwa, że chirp jest problematyczny
(wartość między 0 a 1, gdzie 0 = chirp na pewno normalny, 1 = chirp na pewno problematyczny).
Każdy wiersz reprezentuje chirp opublikowany na Chirper Y, z następującymi atrybutami:
id – unikalny identyfikator chirp-achirp – tekst chirp-alabel – tylko w train.csv, 1 (problematyczny) / 0 (normalny)Końcowy cel: przewiduj label dla wierszy z test.csv.
Pierwsze dwa podzadania sprawdzają prostą analizę chirp-ów.
Ostatnie podzadanie ocenia wydajność modelu klasyfikacji.
Określ długość każdego chirp-a jako liczbę znaków.
Wyświetl dla tego podzadania liczbę całkowitą.
Policz ile wystąpień znaku # znajduje się w chirp-ie
(ważny wskaźnik dla nadmiernych hashtag-ów, ulubionych przez spamerów 😄).
Zbuduj model klasyfikacji, który przewiduje prawdopodobieństwo, że chirp
jest problematyczny (p ∈ [0,1]) dla każdego wiersza z testu.
Ocena odbywa się za pomocą krzywej ROC i AUC (Area Under the ROC Curve).
Podzadania 1–2 są oceniane dokładnie (przez porównanie).
Plik submission.csv musi zawierać po 3 linie dla każdego wiersza z testu,
odpowiadające 3 podzadaniom.
Struktura:
subtaskID,datapointID,answergdzie:
gdzie:
id# (liczba całkowita)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083Dla Podzadania 3, ocena odbywa się za pomocą ROC AUC (Area Under the ROC Curve).
Jest to unikalna miara, która syntetyzuje wydajność klasyfikatora
dla wszystkich możliwych progów decyzyjnych.
Rysuje się krzywą ROC, która przedstawia:
Pole pod krzywą (AUC) oblicza się za pomocą reguły trapezów:
Interpretacja wyniku: