Težina
Vaš najbolji rezultat
N/D
Redakcija međunarodne novinske agencije svakodnevno upravlja tisućama članaka iz različitih područja: ekonomije, politike, znanosti, tehnologije i okoliša. Kako bi mogla brzo arhivirati i distribuirati informacije, svaki članak mora biti uvrsten u tematsku kategoriju.
Zbog tehničke greške, oznake nekih nedavnih članaka su izgubljene. Redakcija se obraća tebi da izgradiš pametan sustav koji može automatski klasificirati novinske članke na temelju njihovog sadržaja.
Dane su dvije ulazne datoteke:
train.csv – sadrži novinske članke za koje je kategorija poznatatest.csv – sadrži novinske članke bez kategorijeSvaki članak je identificiran jedinstvenim id i ima pridružen tekst.
Koristeći podatke iz train.csv, trebaš izgraditi model klasifikacije koji će predvidjeti oznaku (label) svakog članka iz test.csv.
Rezultat će biti spremljen u datoteku submission.csv.
train.csvSadrži sljedeće stupce:
id – jedinstveni identifikator članka (string, npr. 000001)text – sadržaj člankalabel – kategorija članka (cijeli broj)Primjer:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvSadrži sljedeće stupce:
id – jedinstveni identifikatortext – sadržaj člankaPrimjer:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvDatoteka generirana za predaju mora biti u csv formatu i sadržavati sljedeće:
id – identifikator člankalabel – predviđena kategorijaPrimjer:
id,label120001,2120002,3120003,3train.csv.Predviđanja će biti uspoređena sa stvarnim oznakama i izračunat će se točnost:
accuracy = (broj_točnih_predviđanja / ukupan_broj_predviđanja)Konačni rezultat se izračunava na temelju postignute točnosti koristeći sljedeća pravila: