Тежина
Твој најбољи резултат
Н/Д
Redakcija jedne međunarodne novinske agencije svakodnevno upravlja hiljadama članaka iz različitih oblasti: ekonomija, politika, nauka, tehnologija i životna sredina. Da bi mogla brzo da arhivira i distribuira informacije, svaki članak mora biti svrstana u tematsku kategoriju.
Zbog tehničke greške, etikete nekih nedavnih članaka su izgubljene. Redakcija se obraća tebi da konstruišeš inteligentan sistem koji može automatski da klasifikuje novinske članke na osnovu njihovog sadržaja.
Daju se dva ulazna fajla:
train.csv – sadrži novinske članke za koje je kategorija poznatatest.csv – sadrži novinske članke bez kategorijeSvaki članak je identifikovan jedinstvenim id i ima pridružen tekst.
Koristeći podatke iz train.csv, trebaš da konstruišeš model klasifikacije koji će predvideti etiketu (label) svakog članka iz test.csv.
Rezultat će biti sačuvan u fajlu submission.csv.
train.csvSadrži sledeće kolone:
id – jedinstveni identifikator članka (string, npr. 000001)text – sadržaj člankalabel – kategorija članka (ceo broj)Primer:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvSadrži sledeće kolone:
id – jedinstveni identifikatortext – sadržaj člankaPrimer:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvFajl generisan za submisiju treba da bude u csv formatu i da sadrži sledeće:
id – identifikator člankalabel – predviđena kategorijaPrimer:
id,label120001,2120002,3120003,3train.csv.Predikcije će biti poređene sa stvarnim etiketama i izračunaće se tačnost:
accuracy = (broj_tačnih_predikcija / ukupan_broj_predikcija)Finalni rezultat se izračunava na osnovu postignute tačnosti koristeći sledeća pravila: