Vanskelighetsgrad
Din beste poengsum
N/A
Det er tillatt å bruke forhåndstrente språkmodeller (f.eks. BERT, RoBERTa, sentence-transformers) med lastede vekter. GPU-akselerasjon for trening og inferens er fullt tillatt. Klassiske NLP-pipelines basert på TF-IDF er også tillatt og oppmuntret.
Et sted på de tørre slettene i New Mexico, 1883.
Den gamle sheriffen Clem Dudley hadde en vane som ingen av hans betjenter noen gang forsto: hver kveld, uansett hvor lang dagen hadde vært, la han hatten på hestesalen, la seg ned på teppet og så rett opp mot himmelen.
"Stjernene lyver ikke", pleide han å si. "Enhver rømling, enhver landstryker, enhver ærlig mann — alle ser på den samme himmelen."
En augustnatt, utslitt etter tre dager med å forfølge Vega-gjengen gjennom ørkenen, la Clem seg under en himmel svart som blekk, strødd med flere stjerner enn han noen gang hadde talt. Han prøvde å sovne da stjernene begynte å bevege seg — sakte i starten, som glør båret av vinden fra et døende bål. Deretter raskere og raskere. De trakk linjer mellom hverandre. Trekanter. Spiraler. Dyr. Tall. Former han ikke visste navnet på.
"Det må være varmen", mumlet han. Men han fortsatte å se.
Formene ble til ord. Ikke talt — følt. Hvert stjernebilde virket å bære en mening, en tyngde, en historie som hang ved det som en etterlysningsplakat på en sheriff-tavle. Han strakte seg etter blyanten for å notere dem ned, og i det øyeblikket — ingenting.
Han våknet et annet sted.
Landet mellom stjernene. Det var det de kalte det.
Det var et enormt og stille territorium der himmelen var bakken, og stjernebildene var landsbyer — hver en gruppe stjerner arrangert i en form, og hver form bar et navn som ventet på å bli matchet med sin historie. Innbyggerne i dette landet, Stjerneskriverne, hadde ført nøyaktige logger i århundrer: dagbøker, dikt, reiseskildringer, legender — alt skrevet av mennesker som hadde sett de samme stjerneformene nedenfra, fra jorden.
Men noe hadde gått galt. En stor himmelstorm — de lokale kalte den Spredningen — hadde revet hver merkelapp av hvert stjernebilde og kastet dem for vinden. Nå fløt tusenvis av tekster løst over stjerneformene de en gang beskrev, og Stjerneskriverne kunne ikke lenger si hvilken historie som tilhørte hvilken himmel.
Clem fikk overlevert en stjerneglimt-stjerne og en enkel instruks:
"Match ordene tilbake til stjernene, sheriff. Før neste storm kommer."
Du får utdelt et sett med stjernebilder, hver beskrevet av en sekvens med 2D-punkter som danner en geometrisk form (f.eks. et kors, en spiral, en femkantet figur, sifre som 6, 7, 8, kombinasjoner av sifre, osv.). Du får også en stor pool med kandidat-tekstfragmenter — dagboknotater, legender, beskrivelser — hver opprinnelig skrevet om ett spesifikt stjernebilde.
Målet ditt er å bygge en modell som er i stand til å tilordne riktig stjernebilde til hver tekst fra poolen, utelukkende basert på det semantiske og strukturelle forholdet mellom koordinatgeometrien og tekstinnholdet.
train.csv inneholder 300 stjernebilde-tekst-par med etiketter:
| Kolonne | Beskrivelse |
|---|---|
id | Stjernebildets ID (0-299) |
coords | 728-dimensjonal koordinatvektor, separert med pipes: \|x1\|x2\|...\|x728\| |
text | Det tilhørende litterære fragmentet |
test.csv inneholder 50 sekvenser av stjernebilder uten etiketter (datapointID 1-50):
| Kolonne | Beskrivelse |
|---|---|
datapointID | Heltall fra 1 til 50 |
coords | Samme pipe-format som i treningssettet |
Hver datapointID opptrer 40-65 ganger. Det oppgis ingen tekstetiketter.
candidates.csv inneholder 500 tekstfragmenter:
| Kolonne | Beskrivelse |
|---|---|
text_id | Heltall 0-499 |
text | Et litterært fragment (dagbok, dikt, legende) |
Innsendingsfilen må være i CSV-format med følgende kolonner:
| Felt | Beskrivelse |
|---|---|
subtaskID | Må være 1 for alle rader |
datapointID | Heltall 1-50, identifikatoren for test-stjernebildet |
answer | Den predikerte text_id (heltall 0-499) |
Hver av de 50 datapointID-ene fra testen må forekomme nøyaktig én gang.
Eksempel:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Hver prediksjon evalueres som en single-label klassifisering over de 500 kandidat-tekst-ID-ene. Prediksjonen er enten riktig (1) eller feil (0).
Den endelige metrikken er antall riktige prediksjoner / 50.
Råskårer konverteres til konkurransepoeng ved hjelp av en lineær funksjon med en minimumsterskel:
| Accuracy | Poeng |
|---|---|
| < 0.30 | 0 poeng |
| >= 0.85 | 100 poeng |
| Mellomliggende (0.30 - 0.85) | Lineær skalering mellom 0 og 100 |
Kort sagt: du må matche minst 15 av 50 stjernebilder riktig (accuracy = 0.30) for å få poeng, mens riktig matching av 43 eller flere (accuracy >= 0.85) gir full pott.
"Stjernene lyver ikke. Du kan stole mer på en stjerne enn på en mann..." — Sheriff Clem Dudley, 1883