Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Det är uttryckligen tillåtet att använda förtränade språkmodeller (t.ex. BERT, RoBERTa, sentence-transformers) med laddade vikter. GPU-acceleration för träning och inferens är helt tillåten. Klassiska NLP-pipelines baserade på TF-IDF är också tillåtna och uppmuntras.
Någonstans på New Mexicos torra slätter, 1883.
Den gamle sheriffen Clem Dudley hade en vana som ingen av hans vicesheriffer någonsin förstod: varje kväll, oavsett hur lång dagen hade varit, lade han sin hatt på hästens sadel, lade sig på sin filt och tittade rakt upp mot himlen.
"Stjärnorna ljuger inte", brukar han säga. "Varje flykting, varje luffare, varje ärlig man — alla tittar de på samma himmel."
En augustinatt, utmattad efter tre dagars jakt på Vega-ligan genom öknen, lade sig Clem under en himmel svart som bläck, beströdd med fler stjärnor än han någonsin räknat. Han försökte somna när stjärnorna började röra på sig — långsamt till en början, som glöd som bärs av vinden från en döende eld. Sedan allt snabbare. De drog linjer mellan varandra. Trianglar. Spiraler. Djur. Siffror. Former han inte visste namnet på.
"Det måste vara värmen", mumlade han. Men han fortsatte att titta.
Formerna blev till ord. Inte talade — kända. Varje stjärnbild tycktes bära en mening, en tyngd, en historia som hängde vid den som en efterlysningsaffisch på en sheriffs anslagstavla. Han sträckte sig efter sin penna för att anteckna dem, och då — ingenting.
Han vaknade upp på en annan plats.
Landet mellan stjärnorna. Det var vad de kallade det.
Det var ett vidsträckt och tyst territorium där himlen var marken och stjärnbilderna var byar — var och en en grupp stjärnor arrangerade i en form, och varje form bar ett namn som väntade på att matchas med sin historia. Invånarna i detta land, Stjärnskribenterna, hade fört noggranna register i århundraden: dagböcker, dikter, reseskildringar, legender — alla skrivna av människor som sett samma stjärnformer nerifrån jorden.
Men något hade gått fel. En stor himmelsk storm — lokalbefolkningen kallade den Förskingringen — hade slitit loss varje etikett från varje stjärnbild och kastat dem för vinden. Nu svävade tusentals texter lösa ovanför de stjärnformer de en gång beskrivit, och Stjärnskribenterna kunde inte längre avgöra vilken historia som tillhörde vilken himmel.
Clem räcktes en stjärnljusbricka och en enkel instruktion:
"Matcha orden tillbaka till stjärnorna, sheriff. Innan nästa storm kommer."
Du får en uppsättning stjärnbilder, var och en beskriven genom en sekvens av 2D-punkter som bildar en geometrisk form (t.ex. ett kors, en spiral, en femkantig figur, siffror som 6, 7, 8, kombinationer av siffror, etc). Du får också en stor pool av kandidattextfragment — dagboksanteckningar, legender, beskrivningar — där varje fragment ursprungligen skrevs om en specifik stjärnbild.
Målet är att bygga en modell som kan tilldela varje text från poolen till rätt stjärnbild, baserat enbart på det semantiska och strukturella förhållandet mellan koordinaternas geometri och textens innehåll.
train.csv innehåller 300 par av stjärnbild-text med etiketter:
| Kolumn | Beskrivning |
|---|---|
id | Stjärnbildens ID (0-299) |
coords | 728-dimensionell koordinatvektor, separerad med vertikalstreck: \|x1\|x2\|...\|x728\| |
text | Motsvarande litterära fragment |
test.csv innehåller 50 sekvenser av stjärnbilder utan etiketter (datapointID 1-50):
| Kolumn | Beskrivning |
|---|---|
datapointID | Heltal från 1 till 50 |
coords | Samma format med pipes som i träningen |
Varje datapointID förekommer 40-65 gånger. Inga textetiketter tillhandahålls.
candidates.csv innehåller 500 textfragment:
| Kolumn | Beskrivning |
|---|---|
text_id | Heltal 0-499 |
text | Ett litterärt fragment (dagbok, dikt, legend) |
Inlämningsfilen måste vara i CSV-format med följande kolumner:
| Fält | Beskrivning |
|---|---|
subtaskID | Måste vara 1 för alla rader |
datapointID | Heltal 1-50, identifierare för teststjärnbilden |
answer | Förutspått text_id (heltal 0-499) |
Var och en av de 50 datapointID-värdena i testet måste förekomma exakt en gång.
Exempel:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Varje förutsägelse utvärderas som en single-label klassificering över de 500 kandidat-text-ID:na. Förutsägelsen är antingen korrekt (1) eller inkorrekt (0).
Slutmåttet är antalet korrekta förutsägelser / 50.
Råpoängen omvandlas till tävlingspoäng med hjälp av en linjär funktion med ett minimitröskelvärde:
| Accuracy | Poäng |
|---|---|
| < 0.30 | 0 poäng |
| >= 0.85 | 100 poäng |
| Mellanliggande (0.30 - 0.85) | Linjär skalning mellan 0 och 100 |
Kort sagt: du måste matcha minst 15 av 50 stjärnbilder korrekt (accuracy = 0.30) för att få några poäng, och att matcha 43 eller fler korrekt (accuracy >= 0.85) ger maximal poäng.
"Stjärnorna ljuger inte. Man kan lita mer på en stjärna än på en människa..." — Sheriff Clem Dudley, 1883