Raskusaste
Sinu parim tulemus
Puudub
Lubatud on kasutada eelnevalt treenitud keelemudeleid (nt BERT, RoBERTa, sentence-transformers) koos laetud kaaludega. GPU kiirendus treenimiseks ja inferentsiks on täielikult lubatud. Samuti on lubatud ja julgustatud klassikalised TF-IDF-põhised NLP-torustikud.
Kusagil New Mexico kuivadel tasandikel, 1883.
Vanal šerifil Clem Dudley'l oli harjumus, mida ükski abišerif kunagi ei mõistnud: igal õhtul, hoolimata sellest, kui pikk päev oli olnud, asetas ta oma kaabu hobuse sadulale, heitis tekile ja vaatas otse üles taevasse.
"Tähed ei valeta," tavatses ta öelda. "Iga põgenik, iga hulkur, iga aus mees — nad kõik vaatavad sama taevast."
Ühel augustiööl, olles kurnatud pärast kolmepäevast Vega jõugu jälitamist kõrbes, heitis Clem pikali tindi musta taeva alla, mis oli täis rohkem tähti, kui ta kunagi loendanud oli. Ta üritas uinuda, kui tähed hakkasid liikuma — algul aeglaselt, nagu sureva lõkke tuulega kantud söed. Seejärel üha kiiremini. Nad joonistasid omavahel jooni. Kolmnurki. Spiraale. Loomi. Numbreid. Kujundeid, mille nime ta ei teadnud.
"See peab olema kuumusest," pomises ta. Kuid ta vaatas ikka edasi.
Kujunditest said sõnad. Mitte lausutud — vaid tuntud. Iga tähtkuju näis kandvat tähendust, raskust, lugu, mis rippus selle küljes nagu tagaotsimiskuulutus šerifi teadetetahvlil. Ta sirutas käe pliiatsi järele, et need üles märkida, ja siis — mitte midagi.
Ta ärkas mujal.
Tähtedevaheline maa. Nii nad seda kutsusid.
See oli tohutu ja vaikne territoorium, kus taevas oli maapind ja tähtkujud olid külad — igaüks neist tähtede rühm, mis oli seatud teatud kujundisse, ja iga kujund kandis nime, mis ootas oma looga kokkuviimist. Selle maa elanikud, Tähtede Kirjutajad, olid sajandeid pidanud täpset arvet: päevikud, luuletused, reisikirjad, legendid — kõik kirjutatud inimeste poolt, kes olid vaadanud neid samu tähekujundeid alt maapealt.
Kuid midagi oli valesti läinud. Suur taevane torm — kohalikud kutsusid seda Hajumiseks — oli rebinud igalt tähtkujult sildi ja lennutanud need tuulde. Nüüd hõljusid tuhanded tekstid lahtiselt nende tähekujundite kohal, mida nad kunagi kirjeldasid, ning Tähtede Kirjutajad ei osanud enam öelda, milline lugu millise taeva juurde kuulus.
Clemile anti tähevalgusest märk ja lihtne juhis:
"Viige sõnad tähtedega uuesti kokku, šerif. Enne kui saabub järgmine torm."
Sulle antakse komplekt tähtkujusid, millest igaüks on kirjeldatud 2D-punktide jadana, mis moodustavad geomeetrilise kujundi (nt rist, spiraal, viienurkne kujund, numbrid nagu 6, 7, 8, numbrite kombinatsioonid jne). Sulle antakse ka suur hulk kandidaattekste — päevikusissekandeid, legende, kirjeldusi —, millest igaüks on algselt kirjutatud ühe konkreetse tähtkuju kohta.
Sinu eesmärk on luua mudel, mis suudab igale tekstile õigesti määrata vastava tähtkuju, tuginedes eranditult koordinaatide geomeetria ja teksti sisu vahelisele semantilisele ja struktuursele seosele.
train.csv sisaldab 300 tähtkuju-teksti paari koos siltidega:
| Veerg | Kirjeldus |
|---|---|
id | Tähtkuju ID (0-299) |
coords | 728-mõõtmeline koordinaatide vektor, eraldatud püstkriipsudega: \|x1\|x2\|...\|x728\| |
text | Vastav kirjanduslik fragment |
test.csv sisaldab 50 tähtkujude jada ilma siltideta (datapointID 1-50):
| Veerg | Kirjeldus |
|---|---|
datapointID | Täisarv 1 kuni 50 |
coords | Sama püstkriipsudega vorming nagu treeningandmetes |
Iga datapointID esineb 40-65 korda. Tekstisilte ei ole antud.
candidates.csv sisaldab 500 tekstifragmenti:
| Veerg | Kirjeldus |
|---|---|
text_id | Täisarv 0-499 |
text | Kirjanduslik fragment (päevik, luuletus, legend) |
Esitatav fail peab olema CSV-vormingus järgmiste veergudega:
| Väli | Kirjeldus |
|---|---|
subtaskID | Peab olema 1 kõigi ridade puhul |
datapointID | Täisarv 1-50, test-tähtkuju identifikaator |
answer | Ennustatud text_id (täisarv 0-499) |
Igaüks 50-st testi datapointID-st peab esinema täpselt ühe korra.
Näide:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Iga ennustust hinnatakse kui ühe sildiga klassifitseerimist 500 kandidaat-teksti ID üle. Ennustus on kas õige (1) või vale (0).
Lõplik mõõdik on õigete ennustuste arv / 50.
Toored tulemused teisendatakse võistluspunktideks, kasutades minimaalse lävendiga lineaarset funktsiooni:
| Täpsus | Punktid |
|---|---|
| < 0.30 | 0 punkti |
| >= 0.85 | 100 punkti |
| Vahepealne (0.30 - 0.85) | Lineaarne skaleerimine 0 ja 100 vahel |
Lühidalt: punktide saamiseks peate õigesti kokku viima vähemalt 15 tähtkuju 50-st (täpsus = 0.30) ning 43 või enama õige vaste (täpsus >= 0.85) korral saate maksimaalsed punktid.
"Tähed ei valeta. Tähte võib usaldada rohkem kui inimest..." — Šerif Clem Dudley, 1883