Задача #39
Автор:Mihai Nan
Сложность
Ваш лучший результат
Н/Д
В Библиотеке Великого Королевства архивариусы сталкиваются с всё более сложной задачей:
тысячи рукописей, пергаментов и старинных хроник нужно организовать, сравнить и проиндексировать.
Чтобы помочь им, предки создали легендарный механизм: Оракул схожести. Это
устройство, способное определить с замечательной точностью, насколько похожи
два фрагмента текста, возвращая оценку от 0 до 5.
Но механизм со временем деградировал, и Великий Совет Архивариусов решил, что нужна
современная версия, построенная с использованием машинного обучения.
Для этого в ваше распоряжение предоставлены два файла:
train.csv - пергаменты, аннотированные вручную писцамиtest.csv - новые пары, которые должно проанализировать ваше решениеВаша задача - восстановить Оракул через серию анализов и финальную предсказательную модель.
Каждая строка в файлах train.csv и test.csv представляет пару предложений:
Конечная цель - предсказать score для каждой строки из test.csv.
Для первых подзадач нужно проанализировать данные, предоставленные в train.csv и test.csv,
и извлечь различную релевантную информацию о предложениях из теста.
Вычислите длину каждого предложения (sentence1 и sentence2) для каждой строки из тестового набора
и пометьте пару в зависимости от средней длины:
Short если среднее < 50Medium если 50 ≤ среднее < 100Long если среднее ≥ 100Для каждой строки из test вычислите количество слов в каждом предложении (sentence1 и sentence2) и определите общее количество по формуле:
общее_количество = кол_слов(sentence1) + кол_слов(sentence2)Определите абсолютную разность между длиной sentence1 и длиной sentence2
для каждой строки из test.
Другими словами, для каждой строки нужно вычислить:
|кол_символов(sentence1) - кол_символов(sentence2)|Постройте модель машинного обучения, способную предсказать числовое значение score
для каждой строки из test.csv.
Финальная оценка будет проводиться с использованием MAE (Mean Absolute Error), вычисляемого следующим образом:
Метрика для Подзадачи 4:
Для подзадач 1-3 ответы оцениваются точно.
Файл submission.csv должен содержать 4 строки для каждой строки из test,
соответствующие 4 подзадачам.
Структура:
subtaskID datapointID answerЗначение колонок:
subtaskID – число от 1 до 4
datapointID – sampleID из test
answer – результат:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Удачи! Великий Совет Архивариусов возлагает на вас надежды по возрождению Оракула схожести! 🧙♂️