Moeilijkheid
Jouw beste score
N.v.t.
De redactie van een internationaal persbureau beheert dagelijks duizenden artikelen uit verschillende domeinen: economie, politiek, wetenschap, technologie en milieu. Om informatie snel te kunnen archiveren en distribueren, moet elk artikel worden ingedeeld in een thematische categorie.
Door een technische storing zijn de labels van enkele recente artikelen verloren gegaan. De redactie doet een beroep op jou om een intelligent systeem te bouwen dat nieuwsartikelen automatisch kan classificeren op basis van hun inhoud.
Er worden twee invoerbestanden gegeven:
train.csv – bevat nieuwsartikelen waarvan de categorie bekend istest.csv – bevat nieuwsartikelen zonder categorieElk artikel wordt geïdentificeerd door een unieke id en heeft een bijbehorende tekst.
Met behulp van de gegevens uit train.csv moet je een classificatiemodel bouwen dat het label (label) van elk artikel uit test.csv voorspelt.
Het resultaat wordt opgeslagen in een bestand submission.csv.
train.csvBevat de volgende kolommen:
id – unieke identificator van het artikel (string, bijv. 000001)text – inhoud van het artikellabel – categorie van het artikel (geheel getal)Voorbeeld:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvBevat de volgende kolommen:
id – unieke identificatortext – inhoud van het artikelVoorbeeld:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvHet gegenereerde bestand voor indiening moet in csv-formaat zijn en het volgende bevatten:
id – identificator van het artikellabel – voorspelde categorieVoorbeeld:
id,label120001,2120002,3120003,3train.csv.De voorspellingen worden vergeleken met de werkelijke labels en de nauwkeurigheid wordt berekend:
accuracy = (aantal_juiste_voorspellingen / totaal_aantal_voorspellingen)De eindscore wordt berekend op basis van de behaalde nauwkeurigheid met behulp van de volgende regels: