Trudność
Twój najlepszy wynik
Nie dotyczy
Można jawnie używać wstępnie wytrenowanych modeli językowych (np. BERT, RoBERTa, sentence-transformers) z załadowanymi wagami. Akceleracja GPU do trenowania i inferencji jest w pełni dozwolona. Klasyczne potoki NLP oparte na TF-IDF są również dozwolone i zachęcane.
Gdzieś na suchych równinach Nowego Meksyku, rok 1883.
Stary szeryf Clem Dudley miał zwyczaj, którego żaden zastępca nigdy nie zrozumiał: każdego wieczoru, bez względu na to, jak długi był dzień, kładł kapelusz na siodle konia, kładł się na kocu i patrzył prosto w górę, w niebo.
„Gwiazdy nie kłamią”, mawiał. „Każdy uciekinier, każdy włóczęga, każdy uczciwy człowiek — wszyscy patrzą na to samo niebo”.
Pewnej sierpniowej nocy, wyczerpany po trzech dniach ścigania gangu Vegi przez pustynię, Clem położył się pod niebem czarnym jak atrament, usianym większą liczbą gwiazd, niż kiedykolwiek zdołał policzyć. Próbował zasnąć, gdy gwiazdy zaczęły się poruszać — najpierw powoli, jak żar niesiony wiatrem z dogasającego ogniska. Potem coraz szybciej. Kreśliły między sobą linie. Trójkąty. Spirale. Zwierzęta. Cyfry. Kształty, których nazw nie znał.
„To pewnie upał”, mruknął. Ale wciąż patrzył.
Kształty stały się słowami. Nie wypowiedzianymi — odczuwanymi. Każda konstelacja zdawała się nieść znaczenie, ciężar, historię zawieszoną na niej niczym list gończy na tablicy szeryfa. Sięgnął po ołówek, by je zapisać, i wtedy — nastała ciemność.
Obudził się w innym miejscu.
Kraina Między Gwiazdami. Tak ją nazywali.
Było to rozległe i ciche terytorium, gdzie niebo było ziemią, a konstelacje wioskami — każda stanowiła grupę gwiazd ułożonych w kształt, a każdy kształt nosił imię czekające na dopasowanie do swojej historii. Mieszkańcy tej krainy, Gwiezdni Skrybowie, od wieków prowadzili skrupulatne zapiski: dzienniki, wiersze, dzienniki podróży, legendy — wszystkie spisane przez ludzi, którzy patrzyli na te same gwiezdne kształty z dołu, z ziemi.
Ale coś poszło nie tak. Wielka niebiańska burza — miejscowi nazywali ją Rozproszeniem — zerwała każdą etykietę z każdej konstelacji i rzuciła je na wiatr. Teraz tysiące tekstów unosiło się bezładnie nad kształtami gwiazd, które niegdyś opisywały, a Gwiezdni Skrybowie nie potrafili już powiedzieć, która historia należy do którego nieba.
Clemowi wręczono odznakę z gwiezdnego światła i prostą instrukcję:
„Dopasuj słowa z powrotem do gwiazd, szeryfie. Zanim nadejdzie kolejna burza”.
Otrzymujesz zestaw konstelacji gwiazd, z których każda opisana jest sekwencją punktów 2D tworzących kształt geometryczny (np. krzyż, spirala, figura pięcioramienna, cyfry takie jak 6, 7, 8, kombinacje cyfr itp.). Otrzymujesz również dużą pulę kandydackich fragmentów tekstu — wpisów z dziennika, legend, opisów — z których każdy został pierwotnie napisany o jednej konkretnej konstelacji.
Twoim celem jest zbudowanie modelu zdolnego do poprawnego przypisania każdemu tekstowi z puli odpowiadającej mu konstelacji, opierając się wyłącznie na relacji semantycznej i strukturalnej między geometrią współrzędnych a treścią tekstu.
train.csv zawiera 300 par konstelacja-tekst z etykietami:
| Kolumna | Opis |
|---|---|
id | ID konstelacji (0-299) |
coords | 728-wymiarowy wektor współrzędnych, rozdzielony pionowymi kreskami: \|x1\|x2\|...\|x728\| |
text | Odpowiadający fragment literacki |
test.csv zawiera 50 sekwencji konstelacji bez etykiet (datapointID 1-50):
| Kolumna | Opis |
|---|---|
datapointID | Liczba całkowita od 1 do 50 |
coords | Ten sam format z separatorami pipe co w zbiorze treningowym |
Każdy datapointID pojawia się 40-65 razy. Etykiety tekstowe nie są dostarczane.
candidates.csv zawiera 500 fragmentów tekstu:
| Kolumna | Opis |
|---|---|
text_id | Liczba całkowita 0-499 |
text | Fragment literacki (dziennik, wiersz, legenda) |
Plik zgłoszenia musi być w formacie CSV z następującymi kolumnami:
| Pole | Opis |
|---|---|
subtaskID | Musi wynosić 1 dla wszystkich wierszy |
datapointID | Liczba całkowita 1-50, identyfikator konstelacji testowej |
answer | Przewidywane text_id (liczba całkowita 0-499) |
Każdy z 50 testowych datapointID musi pojawić się dokładnie raz.
Przykład:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Każda predykcja jest oceniana jako klasyfikacja single-label spośród 500 kandydackich ID tekstów. Predykcja jest albo poprawna (1), albo błędna (0).
Metryka końcowa to liczba poprawnych predykcji / 50.
Surowe wyniki są przeliczane na punkty konkursowe za pomocą funkcji liniowej z progiem minimalnym:
| Accuracy | Punktacja |
|---|---|
| < 0.30 | 0 punktów |
| >= 0.85 | 100 punktów |
| Pośrednie (0.30 - 0.85) | Skalowanie liniowe między 0 a 100 |
W skrócie: musisz poprawnie dopasować co najmniej 15 z 50 konstelacji (accuracy = 0.30), aby otrzymać jakiekolwiek punkty, a poprawne dopasowanie 43 lub więcej (accuracy >= 0.85) daje maksymalną liczbę punktów.
„Gwiazdy nie kłamią. Możesz bardziej ufać gwieździe niż człowiekowi...” — Szeryf Clem Dudley, 1883