Raskusaste
Sinu parim tulemus
Puudub
Rahvusvahelise pressiagentuur toimetuse haldab igapäevaselt tuhandeid artikleid erinevatest valdkondadest: majandus, poliitika, teadus, tehnoloogia ja keskkond. Et saaks teavet kiiresti arhiveerida ja levitada, tuleb iga artikkel paigutada temaatilisse kategooriasse.
Tehnilise rikke tõttu on mõnede hiljutiste artiklite sildid kaduma läinud. Toimetuse pöördub sinu poole, et ehitada intelligentne süsteem, mis suudaks uudisartikleid automaatselt klassifitseerida nende sisu põhjal.
Antud on kaks sisendfaili:
train.csv – sisaldab uudisartikleid, mille kategooria on teadatest.csv – sisaldab uudisartikleid ilma kategooriataIga artikkel on identifitseeritud unikaalse id-ga ja sellel on seotud tekst.
Kasutades andmeid failist train.csv, tuleb ehitada klassifitseerimismudel, mis ennustab iga artikli silti (label) failist test.csv.
Tulemus salvestatakse faili submission.csv.
train.csvSisaldab järgmisi veerge:
id – artikli unikaalne identifikaator (string, nt 000001)text – artikli sisulabel – artikli kategooria (täisarv)Näide:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvSisaldab järgmisi veerge:
id – unikaalne identifikaatortext – artikli sisuNäide:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvEsitamiseks genereeritud fail peab olema csv formaadis ja sisaldama järgmist:
id – artikli identifikaatorlabel – ennustatud kategooriaNäide:
id,label120001,2120002,3120003,3train.csv.Ennustusi võrreldakse tegelike siltidega ja arvutatakse täpsus:
accuracy = (õigete_ennustuste_arv / ennustuste_koguarv)Lõppskoor arvutatakse saavutatud täpsuse alusel järgmiste reeglite järgi: