Težavnost
Vaš najboljši rezultat
N/A
Uredništvo mednarodne tiskovne agencije dnevno upravlja tisoče člankov iz različnih področij: gospodarstvo, politika, znanost, tehnologija in okolje. Da bi lahko hitro arhivirali in distribuirali informacije, mora biti vsak članek uvrščen v tematsko kategorijo.
Zaradi tehnične okvare so bile izgubljene oznake nekaterih nedavnih člankov. Uredništvo se obrača nate, da zgradiš pameten sistem, ki bo lahko samodejno klasificiral novičarske članke na podlagi njihove vsebine.
Podani sta dve vhodni datoteki:
train.csv – vsebuje novičarske članke, za katere je kategorija znanatest.csv – vsebuje novičarske članke brez kategorijeVsak članek je identificiran z edinstvenim id in ima povezan tekst.
Z uporabo podatkov iz train.csv moraš zgraditi klasifikacijski model, ki bo napovedal oznako (label) vsakega članka iz test.csv.
Rezultat bo shranjen v datoteko submission.csv.
train.csvVsebuje naslednje stolpce:
id – edinstveni identifikator članka (string, npr. 000001)text – vsebina člankalabel – kategorija članka (celo število)Primer:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvVsebuje naslednje stolpce:
id – edinstveni identifikatortext – vsebina člankaPrimer:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvDatoteka, generirana za oddajo, mora biti v formatu csv in vsebovati naslednje:
id – identifikator člankalabel – napovedana kategorijaPrimer:
id,label120001,2120002,3120003,3train.csv.Napovedi bodo primerjane z dejanskimi oznakami in izračunana bo natančnost:
accuracy = (število_pravilnih_napovedi / skupno_število_napovedi)Končni rezultat je izračunan na podlagi dosežene natančnosti z uporabo naslednjih pravil: