Moeilijkheid
Jouw beste score
N.v.t.
In een decembermaand met grote en rustige sneeuwvlokken, toen het dorp nog rook naar verbrand hout en vers hooi uit de schuren, gingen in het midden van het land de poorten open van de Nationale Konijnententoonstelling. In de verwarmde hallen, glanzend onder de gele lichten, brachten fokkers uit alle hoeken van het land hoopvol hun mooiste en best verzorgde dieren.

Exemplaren van drie grote konijnenrassen (elk met goed ingeburgerde uiterlijkheden en gewoonten) zouden elkaar opnieuw ontmoeten op dezelfde plaats.
Elk dier kreeg een plaatje met een ID, en in een dik, in leer gebonden register werden alle kenmerken genoteerd die het onderscheidden van de anderen:
geslacht, gewicht, oorlengte, of de oren hangend zijn of niet, kleur van de vacht, leeftijd, type en kwaliteit van de vacht, lichaamsvorm, of het al dan niet een keelzak heeft, evenals de gezondheidstoestand.
Dit was de manier van de organisatoren om een volledig getuigenis te bewaren van elke harige ziel die de hal binnenkwam.
De organisatoren willen weten hoeveel van de vrouwtjes die naar de tentoonstelling werden gebracht hangende oren hadden en de nobele tint havana droegen. Het resultaat moet u bepalen op basis van de testset (test_data.csv).
Niets ingewikkelds, u hoeft alleen maar een zorgvuldige zoektocht door de registers uit te voeren om hen dit antwoord te geven.
![]() | ![]() | ![]() |
Op een koude ochtend, toen de adem nog als stoom opsteeg in de hal, ontdekten de organisatoren dat een belangrijke pagina uit het officiële register was verdwenen.
Het ras van elk konijn, zo zorgvuldig genoteerd in andere jaren, was nergens meer te vinden.
Er waren exemplaren van drie verschillende rassen gebracht, dat wist men zeker, maar de tekens die hen direct identificeerden waren verdwenen.
Degenen die konijnen goed kenden werden gevraagd om geduldig alle exemplaren te observeren en drie natuurlijke groepen te identificeren, gebruikmakend van alleen de genoteerde kenmerken: overeenkomsten, verschillen, duidelijke grenzen, gebieden waar de dieren dichtbij of ver van elkaar leken qua uiterlijk. Het resultaat moet u bepalen op basis van de testset (test_data.csv).
Om te evalueren hoe goed de rasverdelingen passen, wordt de Adjusted Rand Index (ARI) gebruikt, die de gelijkenis tussen de twee verdelingen meet, gecorrigeerd voor willekeurige overeenkomst.
De ARI-coëfficiënt voor twee verdelingen wordt gedefinieerd als:
waarbij:
RI de Rand-index tussen de twee verdelingen vertegenwoordigt;E[RI] de verwachte waarde is van de Rand-index voor willekeurige verdelingen.Als het verkregen getal dicht bij 1 ligt, betekende dit dat de rasverdeling vakkundig was gedaan en de grenzen tussen de raskenmerken correct waren geïdentificeerd. De organisatoren van de tentoonstelling zijn zeer veeleisend en geven de maximale score voor deze subtask alleen als de verkregen waarde voor de evaluatiemetriek 1 is.
In die december was het aantal deelnemers zo groot geweest dat de juryleden, hoezeer ze zich ook inspanden, niet alle dieren konden beoordelen.
Slechts een deel van hen had een Juryscore gekregen, tussen 0 en 100.
0 betekent dat het exemplaar werd gediskwalificeerd100 betekent dat het exemplaar er een is dat tot kampioen kan worden uitgeroepenVoor de andere konijnen, nog niet beoordeeld, moest een manier worden gevonden om de score te raden die ze zouden hebben gekregen.
Er werd gezocht naar een systeem dat in staat was de verbanden te begrijpen tussen de reeds beoordeelde konijnen en degenen die zonder score waren achtergebleven, zodat de schattingen zo dicht mogelijk bij wat de juryleden zouden hebben gezegd zouden komen.
Hoe kleiner de verschillen, hoe bekwamer en geschikter het systeem wordt geacht om de mensen te helpen die overweldigd zijn door het grote aantal dieren.
Uw taak is om een automatisch scorevoorspellingssysteem te ontwikkelen voor de exemplaren opgenomen in test_data.csv.
Voor de evaluatie van de modelprestaties gebruiken we MSE (Mean Squared Error) — de gemiddelde kwadratische fout. Deze meet het gemiddelde kwadratische verschil tussen de werkelijke waarden en de voorspelde waarden.
De formule is:
waarbij:
y_i de werkelijke score is van exemplaar i,y^_i de door het model voorspelde score is,n het totale aantal exemplaren in de testset is.Lagere MSE-waarden duiden op betere prestaties. Hoe dichter de voorspelde waarden bij de werkelijke liggen, hoe kleiner de fout zal zijn.
Om de verkregen score om te zetten in punten, gebruiken we een eenvoudige regel, gebaseerd op twee drempels:
Het eindresultaat moet een CSV-bestand zijn genaamd output.csv, dat precies 3 kolommen moet bevatten:
subtaskID - vertegenwoordigt het subtasknummer (1, 2, 3)datapointID - die verwijst naar de kolom ID uit de datasetanswer - het antwoord dat overeenkomt met het datapunt voor de respectievelijke subtaskOpmerking: Voor subtask 1, waarbij één enkel antwoord wordt gevraagd voor de hele testdataset, toont u één enkele regel waarvan de datapointID 1 is.
Wij verzoeken u zich in te zetten en de organisatoren van de Nationale Konijnententoonstelling te helpen: een verhaal over passie en prestatie, begrip tussen fokkers, overeenkomsten en verschillen tussen rassen en over de poging om de dierenwereld te zien met dat geduld dat alleen een goede fokker kan hebben aan de vooravond van de feestdagen.