Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Varat tieši izmantot iepriekš apmācītus valodas modeļus (piemēram, BERT, RoBERTa, sentence-transformers) ar ielādētiem svariem (weights). GPU paātrinājums apmācībai un secinājumiem (inference) ir pilnībā atļauts. Klasiskās NLP darbplūsmas, kas balstītas uz TF-IDF, arī ir atļautas un ieteicamas.
Kaut kur Ņūmeksikas sausajos līdzenumos, 1883. gadā.
Vecajam šerifam Klemam Dadlijam bija ieradums, kuru neviens palīgs nekad nesaprata: katru vakaru, neatkarīgi no tā, cik gara bija diena, viņš uzlika cepuri uz zirga segliem, apgūlās uz segas un skatījās tieši augšup, debesīs.
"Zvaigznes nemelo," viņš mēdza teikt. "Jebkurš bēglis, jebkurš klaidonis, jebkurš godīgs cilvēks — visi skatās uz tām pašām debesīm."
Kādā augusta naktī, pārguris pēc trīs dienu ilgas Vegas bandas vajāšanas tuksnesī, Klems apgūlās zem debesīm, kas bija melnas kā tinte un nosētas ar vairāk zvaigznēm, nekā viņš jebkad bija saskaitījis. Viņš mēģināja aizmigt, kad zvaigznes sāka kustēties — sākumā lēnām, kā vēja nestas ogles no dziestoša ugunskura. Pēc tam arvien ātrāk. Tās vilka līnijas savā starpā. Trijstūrus. Spirāles. Dzīvniekus. Ciparus. Formas, kuru nosaukumus viņš nezināja.
"Tas laikam no karstuma," viņš nomurmināja. Bet turpināja skatīties.
Formas kļuva par vārdiem. Ne izrunātiem — sajustiem. Šķita, ka katram zvaigznājam ir sava nozīme, svars, stāsts, kas tam piekarināts kā meklēšanas sludinājums pie šerifa dēļa. Viņš sniedzās pēc zīmuļa, lai tos pierakstītu, un tad — nekā.
Viņš pamodās citur.
Zeme starp Zvaigznēm. Tā viņi to sauca.
Tā bija plaša un klusa teritorija, kur debesis bija zeme, bet zvaigznāji bija ciemati — katrs no tiem bija zvaigžņu grupa, kas sakārtota noteiktā formā, un katrai formai bija nosaukums, kas gaidīja, kad to saskaņos ar tā stāstu. Šīs zemes iedzīvotāji, Zvaigžņu Rakstveži, gadsimtiem ilgi bija veikuši rūpīgus pierakstus: dienasgrāmatas, dzejoļus, ceļojumu žurnālus, leģendas — to visu bija rakstījuši cilvēki, kuri bija skatījušies uz tām pašām zvaigžņu formām no apakšas, no zemes.
Bet kaut kas bija nogājis greizi. Liela debesu vētra — vietējie to sauca par Izkliedi — bija norāvusi katru etiķeti no katra zvaigznāja un aizpūtusi tās vējā. Tagad tūkstošiem tekstu peldēja nesaistīti virs zvaigžņu formām, kuras tie kādreiz aprakstīja, un Zvaigžņu Rakstveži vairs nevarēja pateikt, kurš stāsts pieder kurām debesīm.
Klemam rokās tika ielikta no zvaigžņu gaismas veidota nozīmīte un vienkārša instrukcija:
"Saskaņo vārdus atpakaļ ar zvaigznēm, Šerif. Pirms nāk nākamā vētra."
Jums tiek dots zvaigznāju komplekts, kur katrs ir aprakstīts ar 2D punktu secību, kas veido ģeometrisku formu (piemēram: krusts, spirāle, piecstaru figūra, cipari kā 6, 7, 8, ciparu kombinācijas utt.). Jums tiek dots arī liels kandidātu teksta fragmentu kopums — dienasgrāmatas ieraksti, leģendas, apraksti —, kur katrs sākotnēji rakstīts par vienu konkrētu zvaigznāju.
Mērķis ir izveidot modeli, kas spēj pareizi piesaistīt katram tekstam no kopas atbilstošo zvaigznāju, balstoties tikai uz semantisko un strukturālo saikni starp koordinātu ģeometriju un teksta saturu.
train.csv satur 300 zvaigznāju-tekstu pārus ar marķējumiem:
| Kolonna | Apraksts |
|---|---|
id | Zvaigznāja ID (0-299) |
coords | 728 dimensiju koordinātu vektors, atdalīts ar vertikālām svītrām: \|x1\|x2\|...\|x728\| |
text | Atbilstošais literārais fragments |
test.csv satur 50 zvaigznāju secības bez marķējumiem (datapointID 1-50):
| Kolonna | Apraksts |
|---|---|
datapointID | Vesels skaitlis no 1 līdz 50 |
coords | Tas pats formāts ar svītrām kā apmācības kopā |
Katrs datapointID parādās 40-65 reizes. Teksta marķējumi netiek nodrošināti.
candidates.csv satur 500 teksta fragmentus:
| Kolonna | Apraksts |
|---|---|
text_id | Vesels skaitlis 0-499 |
text | Literārs fragments (dienasgrāmata, dzejolis, leģenda) |
Iesnieguma failam jābūt CSV formātā ar šādām kolonnām:
| Lauks | Apraksts |
|---|---|
subtaskID | Jābūt 1 visām rindām |
datapointID | Vesels skaitlis 1-50, testa zvaigznāja identifikators |
answer | Paredzētais text_id (vesels skaitlis 0-499) |
Katrai no 50 testa datapointID vērtībām jāparādās tieši vienu reizi.
Piemērs:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Katra prognoze tiek vērtēta kā vienas etiķetes klasifikācija starp 500 kandidātu teksta ID. Prognoze ir vai nu pareiza (1), vai nepareiza (0).
Galīgā metrika ir pareizo prognožu skaits / 50.
Neapstrādātie rezultāti tiek pārvērsti konkursa punktos, izmantojot lineāru funkciju ar minimālo slieksni:
| Precizitāte | Punkti |
|---|---|
| < 0.30 | 0 punkti |
| >= 0.85 | 100 punkti |
| Starpposms (0.30 - 0.85) | Lineāra mērogošana starp 0 un 100 |
Īsumā: jums ir pareizi jāsaskaņo vismaz 15 no 50 zvaigznājiem (accuracy = 0.30), lai iegūtu jebkādus punktus, bet pareiza 43 vai vairāk saskaņošana (accuracy >= 0.85) dod maksimālo punktu skaitu.
"Zvaigznes nemelo. Zvaigznei var uzticēties vairāk nekā cilvēkam..." — Šerifs Klems Dadlijs, 1883. gads