Задача #39
Автор:Mihai Nan
Складність
Ваш найкращий результат
Н/Д
У Бібліотеці Великого Королівства архіваріуси стикаються з дедалі складнішим завданням:
тисячі рукописів, пергаментів і старих хронік потрібно організувати, порівняти та проіндексувати.
Щоб допомогти їм, предки створили легендарний механізм: Оракул подібності. Це
пристрій, здатний встановлювати з надзвичайною точністю, наскільки схожі
два фрагменти тексту, повертаючи оцінку від 0 до 5.
Але механізм з часом деградував, і Велика Рада Архіваріусів вирішила, що потрібна
сучасна версія, побудована з використанням машинного навчання.
Для цього тобі надано два файли:
train.csv - пергаменти, анотовані вручну писарямиtest.csv - нові пари, які потрібно проаналізувати твоїм рішеннямТвоє завдання - відновити Оракул через серію аналізів і фінальну предиктивну модель.
Кожен рядок у файлах train.csv і test.csv представляє пару речень:
Кінцева мета - передбачити score для кожного рядка з test.csv.
Для перших підзавдань потрібно проаналізувати дані, надані в train.csv і test.csv
і витягти різну релевантну інформацію про речення з тесту.
Обчисліть довжину кожного речення (sentence1 і sentence2) для кожного рядка з тестового набору
і позначте пару залежно від середньої довжини:
Short якщо середнє < 50Medium якщо 50 ≤ середнє < 100Long якщо середнє ≥ 100Для кожного рядка з тесту обчисліть кількість слів у кожному реченні (sentence1 і sentence2) і визначте загальну кількість за формулою:
загальна_кількість = кількість_слів(sentence1) + кількість_слів(sentence2)Встановіть абсолютну різницю між довжиною sentence1 і довжиною sentence2
для кожного рядка з тесту.
Іншими словами, для кожного рядка потрібно обчислити:
|кількість_символів(sentence1) - кількість_символів(sentence2)|Побудуйте модель машинного навчання, здатну передбачити числове значення score
для кожного рядка з test.csv.
Фінальне оцінювання буде проводитися з використанням MAE (Mean Absolute Error), обчисленого так:
Метрика для Підзавдання 4:
Для підзавдань 1-3 відповіді оцінюються точно.
Файл submission.csv повинен містити 4 рядки для кожного рядка з тесту,
що відповідають 4 підзавданням.
Структура:
subtaskID datapointID answerЗначення стовпців:
subtaskID – число від 1 до 4
datapointID – sampleID з тесту
answer – результат:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74Успіхів! Велика Рада Архіваріусів покладає на вас надії щодо відродження Оракула подібності! 🧙♂️