Vanskelighetsgrad
Din beste poengsum
N/A
Redaksjonen til et internasjonalt pressebyråd håndterer daglig tusenvis av artikler fra ulike områder: økonomi, politikk, vitenskap, teknologi og miljø. For å kunne arkivere og distribuere informasjonen raskt, må hver artikkel plasseres i en tematisk kategori.
På grunn av en teknisk feil har etikettene til noen nylige artikler gått tapt. Redaksjonen henvender seg til deg for å bygge et intelligent system som kan klassifisere nyhetsartikler automatisk basert på innholdet deres.
Det gis to inndatafiler:
train.csv – inneholder nyhetsartikler hvor kategorien er kjenttest.csv – inneholder nyhetsartikler uten kategoriHver artikkel er identifisert med en unik id og har tilknyttet tekst.
Ved å bruke dataene fra train.csv, må du bygge en klassifiseringsmodell som predikerer etiketten (label) til hver artikkel i test.csv.
Resultatet skal lagres i en fil submission.csv.
train.csvInneholder følgende kolonner:
id – unik identifikator for artikkelen (string, f.eks. 000001)text – innholdet i artikkelenlabel – kategorien til artikkelen (heltall)Eksempel:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvInneholder følgende kolonner:
id – unik identifikatortext – innholdet i artikkelenEksempel:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvFilen som genereres for innlevering må være i csv-format og inneholde følgende:
id – identifikatoren til artikkelenlabel – predikert kategoriEksempel:
id,label120001,2120002,3120003,3train.csv.Prediksjoner vil bli sammenlignet med de faktiske etikettene og nøyaktigheten vil bli beregnet:
accuracy = (antall_korrekte_prediksjoner / totalt_antall_prediksjoner)Endelig poengsum beregnes basert på oppnådd nøyaktighet ved hjelp av følgende regler: