Сложность
Ваш лучший результат
Н/Д
Явно разрешено использование предобученных языковых моделей (например: BERT, RoBERTa, sentence-transformers) с загруженными весами. Ускорение GPU для обучения и инференса полностью разрешено. Классические NLP-пайплайны на основе TF-IDF также разрешены и приветствуются.
Где-то на засушливых равнинах Нью-Мексико, 1883 год.
У старого шерифа Клема Дадли была привычка, которую не понимал ни один помощник: каждый вечер, каким бы долгим ни был день, он клал шляпу на седло лошади, ложился на одеяло и смотрел прямо вверх, в небо.
«Звезды не лгут», — говаривал он. «Любой беглец, любой бродяга, любой честный человек — все смотрят на одно и то же небо».
Однажды августовской ночью, измотанный тремя днями погони за бандой Веги по пустыне, Клем растянулся под небом черным, как чернила, усыпанным бóльшим количеством звезд, чем он когда-либо считал. Он пытался уснуть, когда звезды начали двигаться — сначала медленно, как искры, уносимые ветром от гаснущего костра. Затем все быстрее. Они чертили линии между собой. Треугольники. Спирали. Животных. Цифры. Формы, названий которых он не знал.
«Должно быть, это жара», — пробормотал он. Но продолжал смотреть.
Формы стали словами. Не произнесенными — прочувствованными. Каждое созвездие, казалось, несло в себе смысл, вес, историю, висящую на нем, как объявление о розыске на доске шерифа. Он потянулся за карандашом, чтобы записать их, и в этот момент — ничего.
Он проснулся в другом месте.
Край меж Звезд. Так они его называли.
Это была обширная и тихая территория, где небо было землей, а созвездия были деревнями — каждая представляла собой группу звезд, выстроенных в форму, и каждая форма носила имя, ожидавшее сопоставления со своей историей. Жители этого края, Звездные Писцы, веками вели тщательные записи: дневники, поэмы, путевые заметки, легенды — все они были написаны людьми, которые смотрели на те же звездные формы снизу, с земли.
Но что-то пошло не так. Великая небесная буря — местные называли ее Рассеиванием — сорвала все ярлыки с каждого созвездия и развеяла их по ветру. Теперь тысячи текстов парили неприкаянными над формами звезд, которые они когда-то описывали, и Звездные Писцы больше не могли сказать, какая история принадлежит какому небу.
Клему вручили значок из звездного света и простую инструкцию:
«Верни слова звездам, Шериф. Пока не пришла следующая буря».
Вам предоставляется набор созвездий, каждое из которых описано последовательностью 2D-точек, образующих геометрическую фигуру (например: крест, спираль, пятиконечная фигура, цифры 6, 7, 8, комбинации цифр и т. д.). Вам также предоставляется большой пул текстов-кандидатов — записи в дневниках, легенды, описания — каждый из которых изначально был написан об одном конкретном созвездии.
Ваша цель — построить модель, способную правильно сопоставить каждому тексту из пула соответствующее созвездие, основываясь исключительно на семантической и структурной связи между геометрией координат и содержанием текста.
train.csv содержит 300 пар созвездие-текст с метками:
| Колонка | Описание |
|---|---|
id | ID созвездия (0-299) |
coords | 728-мерный вектор координат, разделенный вертикальной чертой: \|x1\|x2\|...\|x728\| |
text | Соответствующий литературный фрагмент |
test.csv содержит 50 последовательностей созвездий без меток (datapointID 1-50):
| Колонка | Описание |
|---|---|
datapointID | Целое число от 1 до 50 |
coords | Тот же формат с разделителем |, что и в обучении |
Каждый datapointID встречается 40-65 раз. Текстовые метки не предоставляются.
candidates.csv содержит 500 текстовых фрагментов:
| Колонка | Описание |
|---|---|
text_id | Целое число 0-499 |
text | Литературный фрагмент (дневник, поэма, легенда) |
Файл решения должен быть в формате CSV со следующими колонками:
| Поле | Описание |
|---|---|
subtaskID | Должно быть 1 для всех строк |
datapointID | Целое число 1-50, идентификатор тестового созвездия |
answer | Предсказанный text_id (целое число 0-499) |
Каждый из 50 тестовых datapointID должен появиться ровно один раз.
Пример:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...Каждое предсказание оценивается как классификация с одной меткой (single-label) по 500 ID текстов-кандидатов. Предсказание либо верно (1), либо неверно (0).
Итоговая метрика — количество верных предсказаний / 50.
Сырые баллы конвертируются в конкурсные очки с помощью линейной функции с минимальным порогом:
| Accuracy | Баллы |
|---|---|
| < 0.30 | 0 баллов |
| >= 0.85 | 100 баллов |
| Промежуточное (0.30 - 0.85) | Линейное масштабирование от 0 до 100 |
Вкратце: вам нужно правильно сопоставить минимум 15 из 50 созвездий (accuracy = 0.30), чтобы получить хоть какие-то баллы, а правильное сопоставление 43 или более (accuracy >= 0.85) приносит максимальный балл.
«Звезды не лгут. Звезде можно доверять больше, чем человеку...» — Шериф Клем Дадли, 1883 год