Obtížnost
Vaše nejlepší skóre
N/A
Redakce mezinárodní tiskové agentury denně spravuje tisíce článků z různých oblastí: ekonomie, politika, věda, technologie a životní prostředí. Aby mohla rychle archivovat a distribuovat informace, musí být každý článek zařazen do tematické kategorie.
Kvůli technické poruše byly ztraceny štítky některých nedávných článků. Redakce se na tebe obrací, abys vytvořil inteligentní systém, který dokáže automaticky klasifikovat zpravodajské články na základě jejich obsahu.
Jsou dány dva vstupní soubory:
train.csv – obsahuje zpravodajské články, pro které je kategorie známatest.csv – obsahuje zpravodajské články bez kategorieKaždý článek je identifikován jedinečným id a má přiřazený text.
Pomocí dat z train.csv musíš vytvořit klasifikační model, který předpoví štítek (label) každého článku z test.csv.
Výsledek bude uložen do souboru submission.csv.
train.csvObsahuje následující sloupce:
id – jedinečný identifikátor článku (string, např. 000001)text – obsah článkulabel – kategorie článku (celé číslo)Příklad:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvObsahuje následující sloupce:
id – jedinečný identifikátortext – obsah článkuPříklad:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvSoubor generovaný pro odevzdání musí být ve formátu csv a obsahovat následující:
id – identifikátor článkulabel – předpovězená kategoriePříklad:
id,label120001,2120002,3120003,3train.csv.Předpovědi budou porovnány se skutečnými štítky a vypočítá se přesnost:
accuracy = (počet_správných_předpovědí / celkový_počet_předpovědí)Finální skóre je vypočítáno na základě dosažené přesnosti podle následujících pravidel: