Trudność
Twój najlepszy wynik
Nie dotyczy
W grudniowym miesiącu z dużymi i spokojnymi płatkami śniegu, gdy wieś wciąż pachniała spalonym drewnem i świeżym sianem wyciągniętym ze stodół, w środku kraju otwierały się bramy Krajowej Wystawy Królików. W ogrzewanych halach, lśniących pod żółtymi światłami, hodowcy ze wszystkich zakątków kraju przywozili z nadzieją najpiękniejsze i najlepiej pielęgnowane zwierzęta.

Okazy z trzech wielkich ras królików (każda z dobrze ugruntowanym wyglądem i zwyczajami) miały się ponownie spotkać w tym samym miejscu.
Każde zwierzę otrzymywało tabliczkę z ID, a w grubym rejestrze oprawionym w skórę zapisywano wszystkie cechy, które odróżniały je od innych:
płeć, wagę, długość uszu, czy uszy są zwisające czy nie, kolor sierści, wiek, typ i jakość sierści, kształt ciała, czy ma podgardle czy nie, oraz stan zdrowia.
To był sposób organizatorów na zachowanie pełnego świadectwa o każdej futrzanej duszy, która weszła do hali.
Organizatorzy chcą wiedzieć, ile spośród samic przywiezionych na wystawę miało zwisające uszy i nosiło szlachetny odcień havana. Wynik należy określić na podstawie zestawu testowego (test_data.csv).
Nic skomplikowanego, trzeba tylko przeprowadzić uważne przeszukanie rejestrów, aby udzielić im tej odpowiedzi.
![]() | ![]() | ![]() |
Pewnego mroźnego poranka, gdy para z oddechu wciąż unosiła się w hali, organizatorzy odkryli, że ważna strona zniknęła z oficjalnego rejestru.
Rasa każdego królika, tak starannie notowana w innych latach, nie mogła już nigdzie zostać znaleziona.
Przywieziono okazy z trzech różnych ras, to było pewne, ale oznaczenia, które je bezpośrednio identyfikowały, zniknęły.
Ci, którzy dobrze znali króliki, zostali poproszeni o cierpliwe obserwowanie wszystkich okazów i zidentyfikowanie trzech naturalnych grup, używając tylko zapisanych cech: podobieństw, różnic, wyraźnych granic, obszarów, gdzie zwierzęta wydawały się podobne lub odległe pod względem wyglądu. Wynik należy określić na podstawie zestawu testowego (test_data.csv).
Aby ocenić, jak dobrze pasują podziały na rasy, używa się Adjusted Rand Index (ARI), który mierzy podobieństwo między dwoma podziałami, dostosowując do losowego dopasowania.
Współczynnik ARI dla dwóch podziałów jest zdefiniowany jako:
gdzie:
RI reprezentuje indeks Rand między dwoma podziałami;E[RI] to oczekiwana wartość indeksu Rand dla losowych podziałów.Jeśli otrzymana liczba jest bliska 1, oznaczało to, że podział na rasy został wykonany umiejętnie i granice między cechami ras zostały poprawnie zidentyfikowane. Organizatorzy wystawy są bardzo wymagający i przyznają maksymalną punktację za ten subtask tylko wtedy, gdy wartość uzyskana dla metryki oceny wynosi 1.
W tym grudniu liczba uczestników była tak duża, że sędziowie, choć bardzo się starali, nie mogli ocenić wszystkich zwierząt.
Tylko część z nich otrzymała Wynik Oceny między 0 a 100.
0 oznacza, że okaz został zdyskwalifikowany100 oznacza, że okaz może zostać ogłoszony mistrzemDla pozostałych królików, jeszcze nieoznaczonych, trzeba było znaleźć sposób na odgadnięcie wyniku, który by otrzymały.
Poszukiwano systemu zdolnego do zrozumienia powiązań między królikami już ocenionymi a tymi pozostałymi bez wyniku, tak aby oszacowania były jak najbliższe temu, co powiedzieliby sędziowie.
Im mniejsze różnice, tym system jest uważany za bardziej sprawny i bardziej odpowiedni do pomocy ludziom przytłoczonym dużą liczbą zwierząt.
Waszym zadaniem jest opracowanie automatycznego systemu przewidywania wyników dla okazów zawartych w test_data.csv.
Do oceny wydajności modelu używamy MSE (Mean Squared Error) — średni błąd kwadratowy. Mierzy on średnią kwadratową różnicę między wartościami rzeczywistymi a przewidywanymi.
Wzór to:
gdzie:
y_i to rzeczywisty wynik okazu i,y^_i to wynik przewidziany przez model,n to całkowita liczba okazów w zestawie testowym.Niższe wartości MSE wskazują na lepszą wydajność. Im bliższe są wartości przewidywane do rzeczywistych, tym mniejszy będzie błąd.
Aby przekształcić uzyskany wynik w punktację, używamy prostej reguły opartej na dwóch progach:
Końcowy wynik musi być plikiem CSV o nazwie output.csv, który zawiera dokładnie 3 kolumny:
subtaskID - reprezentuje numer subtaska (1, 2, 3)datapointID - odnosi się do kolumny ID z zestawu danychanswer - odpowiedź odpowiadająca punktowi danych dla danego subtaskaUwaga: Dla subtaska 1, gdzie wymagana jest jedna odpowiedź dla całego zestawu danych testowych, wyświetlcie jedną linię, której datapointID wynosi 1.
Prosimy o zaangażowanie się i pomoc organizatorom Krajowej Wystawy Królików: historia o pasji i wydajności, zrozumieniu między hodowcami, podobieństwach i różnicach między rasami oraz o próbie zobaczenia świata zwierząt z tą cierpliwością, jaką tylko dobry hodowca może mieć w przededniu świąt.