Difficulté
Votre meilleur score
N/D
Dans un monde globalisé, les messages viennent de tous les coins du monde et peuvent être écrits dans diverses langues. Pour traiter automatiquement ces textes (par exemple, dans des applications automatiques de traduction), il est essentiel de pouvoir identifier la langue de chaque texte.
Ton rôle est de développer un système automatique capable de déterminer la langue d'un texte, en partant de l'entraînement d'un modèle basé sur un ensemble d'exemples étiquetés.
Le système automatique doit fonctionner pour les langues suivantes :
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Tu as à disposition deux fichiers CSV :
Chaque ligne de train.csv a les colonnes suivantes :
SampleID - l'identifiant unique du texteText - le texte originallanguage - la langue du texteExemple :
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", DutchChaque ligne de test.csv a les colonnes suivantes :
SampleID - l'identifiant unique du texteText - le texte pour lequel il faut prédire la langueExemple :
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."Construis un système qui peut identifier la langue du texte pour les textes de test.csv.
Les prédictions doivent être sauvegardées dans un fichier submission.csv avec le format :
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishoù :
SampleID - l'identifiant unique du texte de test.csvlanguage - la langue prédite par ton système, qui doit être une des langues possibles de la liste suivante :Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
Les prédictions seront comparées avec les langues réelles et on calculera l'exactitude :
accuracy = (nombre_prédictions_correctes / nombre_total_prédictions)Le score final est calculé sur la base de l'exactitude obtenue en utilisant les règles suivantes :