Сложность
Ваш лучший результат
Н/Д
В декабрьский месяц с крупными и тихими снежинками, когда село еще пахло жженым деревом и свежим сеном, вынесенным из амбаров, в центре страны открывались ворота Национальной выставки кроликов. В отапливаемых павильонах, сверкающих под желтыми огнями, заводчики со всех уголков страны с надеждой привозили самых красивых и лучше всего ухоженных животных.

Экземпляры трех крупных пород кроликов (каждая с хорошо укоренившимся внешним видом и привычками) должны были снова встретиться в одном месте.
Каждое животное получало табличку с ID, а в толстом регистре, переплетенном в кожу, записывались все признаки, которые отличали его от остальных:
пол, вес, длина ушей, висячие ли у него уши или нет, цвет шерсти, возраст, тип и качество шерсти, форма тела, есть ли подгрудок или нет, а также состояние здоровья.
Это был способ организаторов сохранить полное свидетельство о каждой пушистой душе, вошедшей в павильон.
Организаторы хотят знать, сколько среди самок, привезенных на выставку, имели висячие уши и носили благородный оттенок гавана. Результат нужно определить на основе тестового набора (test_data.csv).
Ничего сложного, нужно только провести внимательный поиск по регистрам, чтобы дать им этот ответ.
![]() | ![]() | ![]() |
В морозное утро, когда пар от дыхания еще поднимался в павильоне, организаторы обнаружили, что важная страница исчезла из официального регистра.
Порода каждого кролика, так тщательно записанная в другие годы, больше нигде не находилась.
Были привезены экземпляры трех разных пород, это знали наверняка, но признаки, которые их непосредственно идентифицировали, исчезли.
Тех, кто хорошо знал кроликов, попросили терпеливо наблюдать за всеми экземплярами и выделить три естественные группы, используя только записанные характеристики: сходства, различия, четкие границы, зоны, где животные казались близкими или далекими по внешнему виду. Результат нужно определить на основе тестового набора (test_data.csv).
Для оценки того, насколько хорошо подходят разделения на породы, используется Adjusted Rand Index (ARI), который измеряет сходство между двумя разделениями, корректируя случайное совпадение.
Коэффициент ARI для двух разделений определяется как:
где:
RI представляет индекс Рэнда между двумя разделениями;E[RI] — ожидаемое значение индекса Рэнда для случайных разделений.Если полученное число близко к 1, это означало, что разделение на породы было сделано умело и границы между характеристиками пород были правильно определены. Организаторы выставки очень требовательны и дают максимальный балл за этот subtask только если полученное значение метрики оценки равно 1.
В том декабре количество участников было настолько большим, что судьи, как ни старались, не смогли оценить всех животных.
Только часть из них получила Оценочный балл от 0 до 100.
0 означает, что экземпляр был дисквалифицирован100 означает, что экземпляр может быть объявлен чемпиономДля остальных кроликов, еще не отмеченных, нужно было найти способ угадать балл, который они бы получили.
Искалась система, способная понять связи между уже оцененными кроликами и оставшимися без балла, чтобы оценки были как можно ближе к тому, что сказали бы судьи.
Чем меньше различия, тем более искусной и подходящей считается система для помощи людям, перегруженным большим количеством животных.
Ваша задача — разработать автоматическую систему предсказания баллов для экземпляров, включенных в test_data.csv.
Для оценки производительности модели используем MSE (Mean Squared Error) — среднеквадратичную ошибку. Она измеряет среднюю квадратичную разность между реальными и предсказанными значениями.
Формула:
где:
y_i — реальный балл экземпляра i,y^_i — балл, предсказанный моделью,n — общее количество экземпляров в тестовом наборе.Меньшие значения MSE указывают на лучшую производительность. Чем ближе предсказанные значения к реальным, тем меньше будет ошибка.
Для преобразования полученного балла в очки используем простое правило, основанное на двух порогах:
Итоговый результат должен быть CSV-файлом с именем output.csv, который должен содержать ровно 3 столбца:
subtaskID - представляет номер subtask'а (1, 2, 3)datapointID - который относится к столбцу ID из датасетаanswer - ответ, соответствующий точке данных для соответствующего subtask'аПримечание: Для subtask'а 1, где требуется один ответ для всего тестового набора данных, выведите одну строку, чей datapointID равен 1.
Просим вас включиться и помочь организаторам Национальной выставки кроликов: история о страсти и производительности, понимании между заводчиками, сходствах и различиях между породами и о попытке увидеть мир животных с тем терпением, которое может иметь только хороший заводчик накануне праздников.