Trudność
Twój najlepszy wynik
Nie dotyczy
Redakcja międzynarodowej agencji prasowej zarządza codziennie tysiącami artykułów pochodzących z różnych dziedzin: ekonomii, polityki, nauki, technologii i środowiska. Aby móc szybko archiwizować i dystrybuować informacje, każdy artykuł musi zostać przypisany do kategorii tematycznej.
Z powodu awarii technicznej etykiety niektórych najnowszych artykułów zostały utracone. Redakcja zwraca się do Ciebie o zbudowanie inteligentnego systemu, który będzie mógł automatycznie klasyfikować artykuły prasowe na podstawie ich treści.
Podane są dwa pliki wejściowe:
train.csv – zawiera artykuły prasowe, dla których kategoria jest znanatest.csv – zawiera artykuły prasowe bez kategoriiKażdy artykuł jest identyfikowany przez unikalny id i ma przypisany tekst.
Używając danych z train.csv, musisz zbudować model klasyfikacji, który przewidzi etykietę (label) każdego artykułu z test.csv.
Wynik zostanie zapisany w pliku submission.csv.
train.csvZawiera następujące kolumny:
id – unikalny identyfikator artykułu (string, np. 000001)text – treść artykułulabel – kategoria artykułu (liczba całkowita)Przykład:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvZawiera następujące kolumny:
id – unikalny identyfikatortext – treść artykułuPrzykład:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvPlik wygenerowany do submisji musi być w formacie csv i zawierać następujące:
id – identyfikator artykułulabel – przewidziana kategoriaPrzykład:
id,label120001,2120002,3120003,3train.csv.Przewidywania zostaną porównane z rzeczywistymi etykietami i zostanie obliczona dokładność:
accuracy = (liczba_poprawnych_przewidywań / całkowita_liczba_przewidywań)Końcowy wynik jest obliczany na podstawie uzyskanej dokładności używając następujących zasad: