Задача #39
Автор:Mihai Nan
Трудност
Твоят най-добър резултат
Н/Д
В Библиотеката на Великото Царство архивистите се сблъскват с все по-трудна задача:
хиляди ръкописи, пергаменти и стари хроники трябва да бъдат организирани, сравнени и индексирани.
За да им помогнат, предците са създали легендарен механизъм: Оракулът на сходството. Това е
устройство, способно да установи с забележителна точност колко сходни
са два текстови фрагмента, връщайки резултат между 0 и 5.
Но механизмът се е влошил с времето и Великият съвет на архивистите е решил, че е необходима
модерна версия, построена с използване на машинно обучение.
За това са ви предоставени два файла:
train.csv - пергаментите, анотирани ръчно от писциtest.csv - нови двойки, които трябва да бъдат анализирани от вашето решениеВашата задача е да възстановите Оракула чрез серия от анализи и финален предиктивен модел.
Всеки ред от файловете train.csv и test.csv представлява двойка изречения:
Крайната цел е да предскажете score за всеки ред от test.csv.
За първите подзадачи трябва да анализирате данните, предоставени в train.csv и test.csv
и да извлечете различна релевантна информация за изреченията от теста.
Изчислете дължината на всяко изречение (sentence1 и sentence2) за всеки ред от тестовото множество
и етикетирайте двойката според средната дължина:
Short ако средната < 50Medium ако 50 ≤ средната < 100Long ако средната ≥ 100За всеки ред от test, изчислете броя думи от всяко изречение (sentence1 и sentence2) и определете общия брой според формулата:
общ_брой = бр_думи(sentence1) + бр_думи(sentence2)Установете абсолютната разлика между дължината на sentence1 и дължината на sentence2
за всеки ред от test.
С други думи, за всеки ред трябва да изчислим:
|бр_символи(sentence1) - бр_символи(sentence2)|Построете модел за машинно обучение, способен да предскаже числовата стойност score
за всеки ред от test.csv.
Финалната оценка ще се направи с използване на MAE (Mean Absolute Error), изчислен така:
Метриката за Подзадача 4 е:
За подзадачи 1-3 отговорите се оценяват точно.
Файлът submission.csv трябва да съдържа по 4 реда за всеки ред от test,
съответстващи на 4-те подзадачи.
Структура:
subtaskID datapointID answerЗначение на колоните:
subtaskID – число между 1 и 4
datapointID – sampleID от test
answer – резултатът:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Успех! Великият съвет на архивистите полага надеждите си във вас за възраждането на Оракула на сходството! 🧙♂️