Difficulté
Votre meilleur score
N/D
La rédaction d'une agence internationale de presse gère quotidiennement des milliers d'articles provenant de domaines variés : économie, politique, science, technologie et environnement. Pour pouvoir archiver et distribuer rapidement les informations, chaque article doit être classé dans une catégorie thématique.
À cause d'une défaillance technique, les étiquettes de certains articles récents ont été perdues. La rédaction fait appel à toi pour construire un système intelligent qui puisse classifier automatiquement les articles de presse sur la base de leur contenu.
Deux fichiers d'entrée sont donnés :
train.csv – contient des articles de presse pour lesquels la catégorie est connuetest.csv – contient des articles de presse sans catégorieChaque article est identifié par un id unique et a un texte associé.
En utilisant les données de train.csv, tu dois construire un modèle de classification qui prédise l'étiquette (label) de chaque article de test.csv.
Le résultat sera sauvegardé dans un fichier submission.csv.
train.csvContient les colonnes suivantes :
id – identifiant unique de l'article (string, ex. 000001)text – contenu de l'articlelabel – catégorie de l'article (nombre entier)Exemple :
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvContient les colonnes suivantes :
id – identifiant uniquetext – contenu de l'articleExemple :
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvLe fichier généré pour la soumission doit être au format csv et contenir ce qui suit :
id – identifiant de l'articlelabel – catégorie préditeExemple :
id,label120001,2120002,3120003,3train.csv.Les prédictions seront comparées aux vraies étiquettes et la précision sera calculée :
accuracy = (nombre_prédictions_correctes / nombre_total_prédictions)Le score final est calculé sur la base de la précision obtenue en utilisant les règles suivantes :