Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Redaktionen för en internationell pressbyrå hanterar dagligen tusentals artiklar från olika områden: ekonomi, politik, vetenskap, teknik och miljö. För att kunna arkivera och distribuera informationen snabbt måste varje artikel kategoriseras inom en tematisk kategori.
På grund av ett tekniskt fel har etiketterna för vissa nyliga artiklar förlorats. Redaktionen vänder sig till dig för att bygga ett intelligent system som kan automatiskt klassificera nyhetsartiklar baserat på deras innehåll.
Två indatafiler ges:
train.csv – innehåller nyhetsartiklar för vilka kategorin är kändtest.csv – innehåller nyhetsartiklar utan kategoriVarje artikel identifieras genom ett unikt id och har en associerad text.
Med hjälp av data från train.csv ska du bygga en klassificeringsmodell som förutsäger etiketten (label) för varje artikel i test.csv.
Resultatet ska sparas i en fil submission.csv.
train.csvInnehåller följande kolumner:
id – unik identifierare för artikeln (string, ex. 000001)text – artikelns innehålllabel – artikelns kategori (heltal)Exempel:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvInnehåller följande kolumner:
id – unik identifieraretext – artikelns innehållExempel:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvDen genererade filen för inlämning ska vara i csv-format och innehålla följande:
id – artikelns identifierarelabel – förutsagd kategoriExempel:
id,label120001,2120002,3120003,3train.csv.Förutsägelserna kommer att jämföras med de verkliga etiketterna och noggrannheten beräknas:
accuracy = (antal_korrekta_förutsägelser / totalt_antal_förutsägelser)Slutpoängen beräknas baserat på den uppnådda noggrannheten enligt följande regler: