Difficulté
Votre meilleur score
N/D
Dans un mois de décembre aux flocons larges et silencieux, quand le village sentait encore le bois brûlé et le foin fraîchement sorti des granges, au milieu du pays s'ouvraient les portes de l'Exposition Nationale des Lapins. Dans les halles chauffées, brillant sous les lumières jaunes, des éleveurs de tous les coins du pays apportaient avec espoir leurs animaux les plus beaux et les mieux soignés.

Des spécimens de trois grandes races de lapins (chacune avec des apparences et des habitudes bien établies) devaient se retrouver à nouveau au même endroit.
Chaque animal recevait une plaquette avec un ID, et dans un registre épais, relié en cuir, étaient notés tous les signes qui le distinguaient des autres :
le sexe, le poids, la longueur des oreilles, si les oreilles sont tombantes ou non, la couleur du pelage, l'âge, le type et la qualité du pelage, la forme du corps, s'il a ou non un fanon, ainsi que l'état de santé.
C'était la façon des organisateurs de garder un témoignage complet sur chaque âme poilue entrée dans la halle.
Les organisateurs souhaitent savoir combien de femelles amenées à l'exposition avaient les oreilles tombantes et portaient la nuance noble de havane. Le résultat doit être déterminé sur la base du jeu de test (test_data.csv).
Rien de compliqué, il faut juste réaliser une recherche attentive dans les registres pour leur offrir cette réponse.
![]() | ![]() | ![]() |
Dans une matinée frigoureuse, la vapeur de la respiration s'élevait encore dans la halle, et les organisateurs ont découvert qu'une page importante avait disparu du registre officiel.
La race de chaque lapin, si attentivement notée les autres années, ne se trouvait plus nulle part.
Des spécimens de trois races différentes avaient été amenés, cela était sûr, mais les signes qui les identifiaient directement avaient disparu.
Ceux qui connaissaient bien les lapins ont été priés d'observer avec patience tous les spécimens et d'identifier trois groupes naturels, en se servant uniquement des traits notés : ressemblances, différences, limites claires, zones où les animaux semblaient proches ou éloignés par l'aspect. Le résultat doit être déterminé sur la base du jeu de test (test_data.csv).
Pour évaluer à quel point les répartitions en races correspondent bien, on utilise l'Adjusted Rand Index (ARI), qui mesure la similarité entre les deux répartitions, en ajustant pour la correspondance aléatoire.
Le coefficient ARI pour deux répartitions est défini comme :
où :
RI représente l'indice Rand entre les deux répartitions ;E[RI] est la valeur attendue de l'indice Rand pour des répartitions aléatoires.Si le nombre obtenu est proche de 1, cela signifiait que la répartition en races avait été faite avec compétence et que les limites entre les caractéristiques des races avaient été identifiées correctement. Les organisateurs de l'exposition sont très exigeants et offrent le score maximum pour ce subtask seulement si la valeur obtenue pour la métrique d'évaluation est 1.
En ce décembre, le nombre de participants avait été si grand que les arbitres, malgré tous leurs efforts, n'avaient pas pu juger tous les animaux.
Seule une partie d'entre eux avait reçu un Score de Jury, entre 0 et 100.
0 signifie que le spécimen a été disqualifié100 signifie que le spécimen est un qui peut être déclaré championPour les autres lapins, non encore marqués, il fallait trouver un moyen de deviner le score qu'ils auraient reçu.
On cherchait un système capable de comprendre les liens entre les lapins déjà notés et ceux restés sans score, afin que les estimations soient le plus proche possible de ce qu'auraient dit les arbitres.
Plus les différences sont petites, plus le système est considéré comme plus habile et plus adapté pour aider les gens submergés par le grand nombre d'animaux.
Votre tâche est de développer un système automatique de prédiction des scores pour les spécimens inclus dans test_data.csv.
Pour l'évaluation de la performance du modèle nous utilisons MSE (Mean Squared Error) — l'erreur quadratique moyenne. Celle-ci mesure la différence moyenne quadratique entre les valeurs réelles et les valeurs prédites.
La formule est :
où :
y_i est le score réel du spécimen i,y^_i est le score prédit par le modèle,n est le nombre total de spécimens dans le jeu de test.Des valeurs plus petites du MSE indiquent une meilleure performance. Plus les valeurs prédites sont proches des réelles, plus l'erreur sera petite.
Pour transformer le score obtenu en points, nous utilisons une règle simple, basée sur deux seuils :
Le résultat final doit être un fichier CSV nommé output.csv, qui doit contenir exactement 3 colonnes :
subtaskID - représente le numéro du subtask (1, 2, 3)datapointID - qui se réfère à la colonne ID du datasetanswer - la réponse correspondant au datapoint pour le subtask respectifNote : Pour le subtask 1, pour lequel on demande une seule réponse pour tout le jeu de données de test, affichez une seule ligne dont le datapointID soit 1.
Nous vous prions de vous impliquer et d'aider les organisateurs de l'Exposition Nationale des Lapins : une histoire sur la passion et la performance, la compréhension entre éleveurs, les ressemblances et différences entre races et sur la tentative de voir le monde des animaux avec cette patience que seul un bon éleveur peut avoir à l'approche des fêtes.