Problème #39
Auteur:Mihai Nan
Difficulté
Votre meilleur score
N/D
Dans la Bibliothèque du Grand Royaume, les archivistes font face à une tâche de plus en plus difficile :
des milliers de manuscrits, parchemins et chroniques anciennes doivent être organisés, comparés et indexés.
Pour les aider, les ancêtres ont créé un mécanisme légendaire : l'Oracle de la similarité. Il s'agit
d'un dispositif capable d'établir, avec une précision remarquable, à quel point
deux fragments de texte se ressemblent, en retournant un score entre 0 et 5.
Mais le mécanisme s'est dégradé avec le temps, et le Grand Conseil des Archivistes a décidé qu'il fallait
une version moderne, construite en utilisant l'apprentissage automatique.
Pour cela, deux fichiers ont été mis à votre disposition :
train.csv - les parchemins annotés manuellement par les scribestest.csv - nouvelles paires qui doivent être analysées par votre solutionVotre tâche est de reconstruire l'Oracle à travers une série d'analyses et un modèle prédictif final.
Chaque ligne des fichiers train.csv et test.csv représente une paire de phrases :
L'objectif final est de prédire score pour chaque ligne de test.csv.
Pour les premières sous-tâches, vous devez analyser les données fournies dans train.csv et test.csv
et extraire différentes informations pertinentes sur les phrases du test.
Calculez la longueur de chaque phrase (sentence1 et sentence2) pour chaque ligne de l'ensemble de test
et étiquetez la paire en fonction de la longueur moyenne :
Short si la moyenne < 50Medium si 50 ≤ moyenne < 100Long si la moyenne ≥ 100Pour chaque ligne du test, calculez le nombre de mots dans chaque phrase (sentence1 et sentence2) et déterminez le nombre total selon la formule :
nombre_total = nb_mots(sentence1) + nb_mots(sentence2)Établissez la différence absolue entre la longueur de sentence1 et la longueur de sentence2
pour chaque ligne du test.
En d'autres termes, pour chaque ligne nous devons calculer :
|nb_caractères(sentence1) - nb_caractères(sentence2)|Construisez un modèle d'apprentissage automatique capable de prédire la valeur numérique score
pour chaque ligne de test.csv.
L'évaluation finale se fera en utilisant MAE (Mean Absolute Error), calculé ainsi :
La métrique pour la Sous-tâche 4 est :
Pour les sous-tâches 1-3, les réponses sont évaluées exactement.
Le fichier submission.csv doit contenir 4 lignes pour chaque ligne du test,
correspondant aux 4 sous-tâches.
Structure :
subtaskID datapointID answerSignification des colonnes :
subtaskID – un nombre entre 1 et 4
datapointID – sampleID du test
answer – le résultat :
Short / Medium / LongsampleID = 1714 :subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Bonne chance ! Le Grand Conseil des Archivistes place ses espoirs en vous pour faire revivre l'Oracle de la similarité ! 🧙♂️