Sværhedsgrad
Din bedste score
N/A
Redaktionen af et internationalt pressebureau håndterer dagligt tusindvis af artikler fra forskellige områder: økonomi, politik, videnskab, teknologi og miljø. For at kunne arkivere og distribuere informationerne hurtigt skal hver artikel placeres i en tematisk kategori.
På grund af en teknisk fejl er etiketterne på nogle nylige artikler gået tabt. Redaktionen henvender sig til dig for at bygge et intelligent system, der kan klassificere nyhedsartikler automatisk baseret på deres indhold.
Der gives to inputfiler:
train.csv – indeholder nyhedsartikler, hvor kategorien er kendttest.csv – indeholder nyhedsartikler uden kategoriHver artikel identificeres med et unikt id og har tilknyttet en tekst.
Ved hjælp af dataene fra train.csv skal du bygge en klassifikationsmodel, der kan forudsige etiketten (label) for hver artikel i test.csv.
Resultatet skal gemmes i en fil kaldet submission.csv.
train.csvIndeholder følgende kolonner:
id – unik identifikator for artiklen (string, f.eks. 000001)text – artiklens indholdlabel – artiklens kategori (heltal)Eksempel:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvIndeholder følgende kolonner:
id – unik identifikatortext – artiklens indholdEksempel:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvDen genererede fil til indsendelse skal være i csv-format og indeholde følgende:
id – artiklens identifikatorlabel – den forudsagte kategoriEksempel:
id,label120001,2120002,3120003,3train.csv.Forudsigelserne vil blive sammenlignet med de faktiske etiketter, og nøjagtigheden vil blive beregnet:
accuracy = (antal_korrekte_forudsigelser / samlet_antal_forudsigelser)Den endelige score beregnes baseret på den opnåede nøjagtighed ved hjælp af følgende regler: