Obtížnost
Vaše nejlepší skóre
N/A
Lze explicitně používat předtrénované jazykové modely (např. BERT, RoBERTa, sentence-transformers) s načtenými váhami. GPU akcelerace pro trénování a inferenci je plně povolena. Klasické NLP pipeline založené na TF-IDF jsou rovněž povoleny a doporučovány.
Kdesi na vyprahlých pláních Nového Mexika, 1883.
Starý šerif Clem Dudley měl zvyk, který žádný z jeho zástupců nikdy nepochopil: každý večer, bez ohledu na to, jak dlouhý byl den, položil klobouk na sedlo koně, natáhl se na deku a díval se přímo vzhůru k obloze.
„Hvězdy nelžou,“ říkával. „Každý uprchlík, každý tulák, každý čestný muž – všichni se dívají na stejné nebe.“
Jedné srpnové noci, vyčerpaný po třech dnech pronásledování bandy Vega pouští, se Clem natáhl pod oblohu černou jako inkoust, posypanou více hvězdami, než kdy dokázal spočítat. Pokoušel se usnout, když se hvězdy začaly hýbat – zpočátku pomalu, jako žhavé uhlíky unášené větrem z dohasínajícího ohně. Pak stále rychleji. Kreslily mezi sebou čáry. Trojúhelníky. Spirály. Zvířata. Číslice. Tvary, pro které neznal jméno.
„To musí být to horko,“ zamumlal. Ale stále se díval.
Tvary se staly slovy. Ne vyslovenými – ale pociťovanými. Zdálo se, že každé souhvězdí nese význam, váhu, příběh, který na něm visí jako plakát „Hledá se“ na šerifově nástěnce. Natáhl se pro tužku, aby si je zapsal, a vtom – nic.
Probudil se jinde.
Říše mezi hvězdami. Tak jí říkali.
Bylo to rozlehlé a tiché území, kde obloha byla zemí a souhvězdí byla vesnicemi – každé tvořila skupina hvězd uspořádaných do tvaru a každý tvar nesl jméno, které čekalo na spojení se svým příběhem. Obyvatelé této říše, Hvězdní písaři, vedli po staletí pečlivé záznamy: deníky, básně, cestovní zápisníky, legendy – vše napsané lidmi, kteří se na ty samé tvary hvězd dívali zdola, ze země.
Něco se však pokazilo. Velká nebeská bouře – místní jí říkali Rozptýlení – strhla každý štítek z každého souhvězdí a rozfoukala je do větru. Nyní se tisíce textů vznášely nespoutaně nad tvary hvězd, které kdysi popisovaly, a Hvězdní písaři už nedokázali říct, který příběh patří ke kterému nebi.
Clemovi byl předán odznak z hvězdného svitu a jednoduchý pokyn:
„Přiřaď slova zpět k hvězdám, šerife. Než přijde další bouře.“
Je vám dána sada souhvězdí, z nichž každé je popsáno sekvencí 2D bodů tvořících geometrický tvar (např. kříž, spirála, pěticípý obrazec, číslice jako 6, 7, 8, kombinace číslic atd.). Dále je vám k dispozici velký soubor kandidátních textových fragmentů – zápisů v deníku, legend, popisů – z nichž každý byl původně napsán o jednom konkrétním souhvězdí.
Vaším cílem je vytvořit model schopný správně přiřadit každému textu ze souboru odpovídající souhvězdí, a to výhradně na základě sémantického a strukturálního vztahu mezi geometrií souřadnic a obsahem textu.
train.csv obsahuje 300 dvojic souhvězdí-text s popisky:
| Sloupec | Popis |
|---|---|
id | ID souhvězdí (0-299) |
coords | 728-rozměrný vektor souřadnic, oddělený svislítky: \|x1\|x2\|...\|x728\| |
text | Odpovídající literární fragment |
test.csv obsahuje 50 sekvencí souhvězdí bez popisků (datapointID 1-50):
| Sloupec | Popis |
|---|---|
datapointID | Celé číslo od 1 do 50 |
coords | Stejný formát se svislítky jako u trénovací sady |
Každé datapointID se objevuje 40-65krát. Textové popisky nejsou k dispozici.
candidates.csv obsahuje 500 textových fragmentů:
| Sloupec | Popis |
|---|---|
text_id | Celé číslo 0-499 |
text | Literární fragment (deník, báseň, legenda) |
Soubor pro odevzdání musí být ve formátu CSV s následujícími sloupci:
| Pole | Popis |
|---|---|
subtaskID | Musí být 1 pro všechny řádky |
datapointID | Celé číslo 1-50, identifikátor testovacího souhvězdí |
answer | Předpovězené text_id (celé číslo 0-499) |
Každé z 50 testovacích datapointID se musí objevit právě jednou.
Příklad:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Každá předpověď je vyhodnocena jako klasifikace s jedním štítkem (single-label) přes 500 kandidátních textových ID. Předpověď je buď správná (1), nebo nesprávná (0).
Výsledná metrika je počet správných předpovědí / 50.
Hrubé skóre je převedeno na soutěžní body pomocí lineární funkce s minimálním prahem:
| Accuracy | Body |
|---|---|
| < 0.30 | 0 bodů |
| >= 0.85 | 100 bodů |
| Mezihodnota (0.30 - 0.85) | Lineární škálování mezi 0 a 100 |
Stručně řečeno: musíte správně přiřadit alespoň 15 z 50 souhvězdí (accuracy = 0.30), abyste získali nějaké body, a správné přiřazení 43 nebo více (accuracy >= 0.85) přináší maximální počet bodů.
„Hvězdy nelžou. Hvězdě můžeš věřit víc než člověku...“ — Šerif Clem Dudley, 1883