Difficoltà
Il tuo miglior punteggio
N/D
È possibile utilizzare esplicitamente modelli di linguaggio pre-addestrati (es: BERT, RoBERTa, sentence-transformers) con pesi caricati. L'accelerazione GPU per l'addestramento e l'inferenza è completamente permessa. Sono inoltre consentite e incoraggiate le pipeline NLP classiche basate su TF-IDF.
Da qualche parte nelle aride pianure del New Mexico, 1883.
Il vecchio Sceriffo Clem Dudley aveva un'abitudine che nessun vice aveva mai compreso: ogni sera, non importa quanto lunga fosse stata la giornata, poggiava il cappello sulla sella del cavallo, si stendeva sulla coperta e guardava dritto in su, verso il cielo.
"Le stelle non mentono", era solito dire. "Ogni fuggitivo, ogni vagabondo, ogni uomo onesto — tutti guardano lo stesso cielo."
Una notte d'agosto, esausto dopo tre giorni passati a inseguire la banda Vega nel deserto, Clem si distese sotto un cielo nero come l'inchiostro, punteggiato da più stelle di quante ne avesse mai contate. Stava cercando di addormentarsi quando le stelle iniziarono a muoversi — lentamente all'inizio, come braci portate dal vento di un fuoco morente. Poi sempre più veloci. Tracciavano linee tra loro. Triangoli. Spirali. Animali. Cifre. Forme di cui non conosceva il nome.
"Deve essere il caldo", mormorò. Ma continuò a guardare.
Le forme divennero parole. Non pronunciate — percepite. Ogni costellazione sembrava portare un significato, un peso, una storia appesa ad essa come un manifesto di ricerca sulla bacheca di uno sceriffo. Allungò la mano verso la matita per annotarle, e in quel momento — il nulla.
Si svegliò da un'altra parte.
Il Reame tra le Stelle. Così lo chiamavano.
Era un territorio vasto e silenzioso dove il cielo era la terra e le costellazioni erano villaggi — ognuno un gruppo di stelle disposte in una forma, e ogni forma portava un nome che aspettava di essere abbinato alla sua storia. Gli abitanti di questo reame, gli Scribi delle Stelle, avevano tenuto registri meticolosi per secoli: diari, poemi, diari di viaggio, leggende — tutti scritti da persone che avevano guardato quelle stesse forme di stelle dal basso, sulla terra.
Ma qualcosa era andato storto. Una grande tempesta celeste — i locali la chiamavano La Dispersione — aveva strappato ogni etichetta da ogni costellazione e le aveva disperse nel vento. Ora migliaia di testi fluttuavano slegati sopra le forme stellari che un tempo descrivevano, e gli Scribi delle Stelle non sapevano più quale storia appartenesse a quale cielo.
A Clem fu consegnata una stella di latta fatta di luce stellare e un'istruzione semplice:
"Riporta le parole alle stelle, Sceriffo. Prima che arrivi la prossima tempesta."
Ti viene fornito un set di costellazioni stellari, ognuna descritta da una sequenza di punti 2D che formano una forma geometrica (es: una croce, una spirale, una figura a cinque punte, cifre come 6, 7, 8, combinazioni di cifre, ecc.). Ti viene inoltre fornito un ampio pool di frammenti di testo candidati — annotazioni di diario, leggende, descrizioni — ognuno scritto originariamente su una singola costellazione specifica.
Il tuo obiettivo è costruire un modello capace di attribuire correttamente a ogni testo del pool la costellazione corrispondente, basandosi esclusivamente sulla relazione semantica e strutturale tra la geometria delle coordinate e il contenuto del testo.
train.csv contiene 300 coppie costellazione-testo con etichette:
| Colonna | Descrizione |
|---|---|
id | ID della costellazione (0-299) |
coords | Vettore di coordinate a 728 dimensioni, separato da barre: \|x1\|x2\|...\|x728\| |
text | Il frammento letterario corrispondente |
test.csv contiene 50 sequenze di costellazioni senza etichette (datapointID 1-50):
| Colonna | Descrizione |
|---|---|
datapointID | Intero da 1 a 50 |
coords | Stesso formato con pipe dell'addestramento |
Ogni datapointID appare 40-65 volte. Non vengono fornite etichette di testo.
candidates.csv contiene 500 frammenti di testo:
| Colonna | Descrizione |
|---|---|
text_id | Intero 0-499 |
text | Un frammento letterario (diario, poema, leggenda) |
Il file di sottomissione deve essere in formato CSV con le seguenti colonne:
| Campo | Descrizione |
|---|---|
subtaskID | Deve essere 1 per tutte le righe |
datapointID | Intero 1-50, l'identificatore della costellazione di test |
answer | Il text_id previsto (intero 0-499) |
Ognuno dei 50 datapointID di test deve apparire esattamente una volta.
Esempio:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Ogni previsione è valutata come una classificazione single-label sui 500 ID di testo candidati. La previsione è corretta (1) o errata (0).
La metrica finale è il numero di previsioni corrette / 50.
I punteggi grezzi vengono convertiti in punti della competizione utilizzando una funzione lineare con una soglia minima:
| Accuracy | Punteggio |
|---|---|
| < 0.30 | 0 punti |
| >= 0.85 | 100 punti |
| Intermedio (0.30 - 0.85) | Scalatura lineare tra 0 e 100 |
In breve: devi abbinare correttamente almeno 15 su 50 costellazioni (accuracy = 0.30) per ottenere punti, mentre l'abbinamento corretto di 43 o più (accuracy >= 0.85) garantisce il punteggio massimo.
"Le stelle non mentono. Puoi fidarti più di una stella che di un uomo..." — Sceriffo Clem Dudley, 1883