Sværhedsgrad
Din bedste score
N/A
I en december-måned med store og stille snefnug, da landsbyen stadig duftede af brændt træ og frisk hø hentet fra laderne, åbnede portene til Den Nationale Kanin-udstilling sig i landets midte. I de opvarmede haller, skinnende under de gule lys, bragte opdrættere fra alle landets hjørner håbefuldt deres smukkeste og bedst plejede dyr.

Eksemplarer fra tre store kaninracer (hver med veletablerede udseender og vaner) skulle mødes igen på samme sted.
Hvert dyr fik en plade med et ID, og i et tykt register, indbundet i læder, blev alle de tegn noteret, der adskilte det fra de andre:
køn, vægt, ørelængde, om ørerne var hængende eller ej, pelsfarve, alder, pelstype og pelskvalitet, kropsform, om det havde dobbelt hage eller ej, samt sundhedstilstand.
Det var arrangørernes måde at bevare et komplet vidnesbyrd om hver lodden sjæl, der kom ind i hallen.
Arrangørerne ønsker at vide, hvor mange af hunnerne bragt til udstillingen havde hængende ører og bar den noble nuance af havana. Resultatet skal I bestemme baseret på testsættet (test_data.csv).
Intet kompliceret, I skal bare foretage en omhyggelig søgning gennem registrene for at give dem dette svar.
![]() | ![]() | ![]() |
En kold morgen, hvor åndedrættets damp stadig steg op i hallen, opdagede arrangørerne, at en vigtig side var forsvundet fra det officielle register.
Racen for hver kanin, så omhyggeligt noteret i andre år, var ikke at finde nogen steder.
Der var blevet bragt eksemplarer fra tre forskellige racer, det vidste man med sikkerhed, men tegnene, der identificerede dem direkte, var forsvundet.
De, der kendte kaniner godt, blev bedt om tålmodigt at observere alle eksemplarerne og identificere tre naturlige grupper, kun ved hjælp af de noterede træk: ligheder, forskelle, klare grænser, områder hvor dyrene syntes tætte eller fjerne i udseende. Resultatet skal I bestemme baseret på testsættet (test_data.csv).
For at evaluere, hvor godt opdelingerne i racer passer, bruges Adjusted Rand Index (ARI), som måler ligheden mellem de to opdelinger, justeret for tilfældig matching.
ARI-koefficienten for to opdelinger er defineret som:
hvor:
RI repræsenterer Rand-indekset mellem de to opdelinger;E[RI] er den forventede værdi af Rand-indekset for tilfældige opdelinger.Hvis det opnåede tal er tæt på 1, betød det, at opdelingen i racer var gjort med dygtighed, og grænserne mellem racernes karakteristika var identificeret korrekt. Udstillingsarrangørerne er meget krævende og giver maksimalt pointtal for dette subtask kun, hvis den opnåede værdi for evalueringsmetrikken er 1.
I den december var antallet af deltagere så stort, at dommerne, uanset hvor meget de anstrengte sig, ikke kunne bedømme alle dyrene.
Kun en del af dem havde fået en Bedømmelsesscore mellem 0 og 100.
0 betyder, at eksemplaret blev diskvalificeret100 betyder, at eksemplaret er et, der kan erklæres mesterFor de andre kaniner, endnu ikke markeret, skulle der findes en måde at gætte scoren på, som de ville have fået.
Man søgte et system, der kunne forstå forbindelserne mellem de allerede bedømte kaniner og dem, der var tilbage uden score, så estimaterne kunne være så tæt som muligt på, hvad dommerne ville have sagt.
Jo mindre forskellene er, jo mere dygtigt og passende anses systemet for at hjælpe folk, der er overvældede af det store antal dyr.
Jeres opgave er at udvikle et automatisk system til forudsigelse af scorer for eksemplarerne inkluderet i test_data.csv.
For evaluering af modellens ydeevne bruger vi MSE (Mean Squared Error) — den gennemsnitlige kvadratiske fejl. Denne måler den gennemsnitlige kvadratiske forskel mellem de reelle værdier og de forudsagte værdier.
Formlen er:
hvor:
y_i er den reelle score for eksemplar i,y^_i er den forudsagte score fra modellen,n er det samlede antal eksemplarer i testsættet.Lavere værdier af MSE indikerer bedre ydeevne. Jo tættere de forudsagte værdier er på de reelle, jo mindre vil fejlen være.
For at transformere den opnåede score til pointtal bruger vi en simpel regel baseret på to tærskler:
Det endelige resultat skal være en CSV-fil kaldet output.csv, som skal indeholde præcis 3 kolonner:
subtaskID - repræsenterer subtask-nummeret (1, 2, 3)datapointID - som refererer til ID-kolonnen i datasættetanswer - svaret svarende til datapunktet for det respektive subtaskNote: For subtask 1, hvor der kræves et enkelt svar for hele testdatasættet, vis en enkelt linje, hvis datapointID er 1.
Vi beder jer om at involvere jer og hjælpe arrangørerne af Den Nationale Kanin-udstilling: en historie om passion og præstation, forståelse mellem opdrættere, ligheder og forskelle mellem racer og om forsøget på at se dyrenes verden med den tålmodighed, som kun en god opdrætter kan have i juletiden.