Difficulté
Votre meilleur score
N/D
L'utilisation explicite de modèles de langage pré-entraînés (ex : BERT, RoBERTa, sentence-transformers) avec des poids chargés est autorisée. L'accélération GPU pour l'entraînement et l'inférence est pleinement permise. Les pipelines NLP classiques basés sur TF-IDF sont également autorisés et encouragés.
Quelque part dans les plaines arides du Nouveau-Mexique, 1883.
Le vieux shérif Clem Dudley avait une habitude qu'aucun adjoint n'avait jamais comprise : chaque soir, quelle que fût la longueur de la journée, il posait son chapeau sur la selle de son cheval, s'allongeait sur sa couverture et regardait droit vers le ciel.
« Les étoiles ne mentent pas », avait-il l'habitude de dire. « Chaque fugitif, chaque vagabond, chaque honnête homme — tous regardent le même ciel. »
Une nuit d'août, épuisé après trois jours de traque de la bande Vega à travers le désert, Clem s'allongea sous un ciel noir comme l'encre, parsemé de plus d'étoiles qu'il n'en avait jamais comptées. Il essayait de s'endormir quand les étoiles commencèrent à bouger — lentement au début, comme des braises portées par le vent d'un feu mourant. Puis de plus en plus vite. Elles traçaient des lignes entre elles. Des triangles. Des spirales. Des animaux. Des chiffres. Des formes dont il ignorait le nom.
« Ça doit être la chaleur », grommela-t-il. Mais il continuait de regarder.
Les formes devinrent des mots. Non pas parlés — ressentis. Chaque constellation semblait porter un sens, un poids, une histoire suspendue à elle comme une affiche de recherche sur le panneau d'un shérif. Il tendit la main vers son crayon pour les noter, et à ce moment-là — plus rien.
Il se réveilla ailleurs.
Le Royaume entre les Étoiles. C'est ainsi qu'ils l'appelaient.
C'était un territoire vaste et silencieux où le ciel était la terre, et les constellations étaient des villages — chacun un groupe d'étoiles disposées selon une forme, et chaque forme portant un nom qui attendait d'être associé à son histoire. Les habitants de ce royaume, les Scribes des Étoiles, tenaient des registres méticuleux depuis des siècles : journaux, poèmes, carnets de route, légendes — tous écrits par des gens qui avaient observé les mêmes formes d'étoiles d'en bas, sur terre.
Mais quelque chose avait mal tourné. Une grande tempête céleste — les habitants l'appelaient La Dispersion — avait arraché chaque étiquette de chaque constellation et les avait jetées au vent. Désormais, des milliers de textes flottaient, détachés, au-dessus des formes d'étoiles qu'ils décrivaient autrefois, et les Scribes des Étoiles ne pouvaient plus dire quelle histoire appartenait à quel ciel.
On remit à Clem un insigne fait de lumière stellaire et une instruction simple :
« Rends les mots aux étoiles, Shérif. Avant que la prochaine tempête n'arrive. »
On vous propose un ensemble de constellations d'étoiles, chacune décrite par une séquence de points 2D formant une forme géométrique (ex : une croix, une spirale, une figure à cinq pointes, des chiffres comme 6, 7, 8, des combinaisons de chiffres, etc.). On vous propose également un large pool de fragments de textes candidats — notes de journal, légendes, descriptions — chacun écrit initialement pour une seule constellation spécifique.
Votre objectif est de construire un modèle capable d'attribuer correctement à chaque texte du pool la constellation correspondante, en se basant exclusivement sur la relation sémantique et structurelle entre la géométrie des coordonnées et le contenu du texte.
train.csv contient 300 paires constellation-texte avec étiquettes :
| Colonne | Description |
|---|---|
id | ID de la constellation (0-299) |
coords | Vecteur de coordonnées de dimension 728, séparé par des barres : \|x1\|x2\|...\|x728\| |
text | Le fragment littéraire correspondant |
test.csv contient 50 séquences de constellations sans étiquettes (datapointID 1-50) :
| Colonne | Description |
|---|---|
datapointID | Entier de 1 à 50 |
coords | Même format avec des pipes que pour l'entraînement |
Chaque datapointID apparaît 40 à 65 fois. Aucune étiquette de texte n'est fournie.
candidates.csv contient 500 fragments de texte :
| Colonne | Description |
|---|---|
text_id | Entier 0-499 |
text | Un fragment littéraire (journal, poème, légende) |
Le fichier de soumission doit être au format CSV avec les colonnes suivantes :
| Champ | Description |
|---|---|
subtaskID | Doit être 1 pour toutes les lignes |
datapointID | Entier 1-50, l'identifiant de la constellation de test |
answer | Le text_id prédit (entier 0-499) |
Chacun des 50 datapointID de test doit apparaître exactement une seule fois.
Exemple :
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Chaque prédiction est évaluée comme une classification à étiquette unique parmi les 500 ID de texte candidats. La prédiction est soit correcte (1), soit incorrecte (0).
La métrique finale est le nombre de prédictions correctes / 50.
Les scores bruts sont convertis en points de compétition à l'aide d'une fonction linéaire avec un seuil minimal :
| Accuracy | Score |
|---|---|
| < 0.30 | 0 points |
| >= 0.85 | 100 points |
| Intermédiaire (0.30 - 0.85) | Échelle linéaire entre 0 et 100 |
En résumé : vous devez faire correspondre correctement au moins 15 constellations sur 50 (accuracy = 0.30) pour obtenir des points, et la correspondance correcte de 43 ou plus (accuracy >= 0.85) rapporte le score maximum.
« Les étoiles ne mentent pas. On peut avoir plus confiance en une étoile qu'en un homme... » — Shérif Clem Dudley, 1883