Svårighetsgrad
Din bästa poäng
Ej tillgänglig
I en decembermånad med stora och lugna snöflingor, när byn fortfarande doftade av bränt trä och färskt hö från ladorna, öppnades portarna till Nationella kaninmässan mitt i landet. I de uppvärmda hallarna, som glänste under de gula ljusen, kom uppfödare från alla hörn av landet med hopp och förde med sig sina vackraste och bäst omhändertagna djur.

Exemplar från tre stora kaninraser (var och en med välgrundade utseenden och vanor) skulle träffas igen på samma plats.
Varje djur fick en skylt med ett ID, och i ett tjockt register, inbundet i läder, antecknades alla tecken som skilde det från de andra:
kön, vikt, öronlängd, om öronen var hängande eller inte, pälsfärg, ålder, pälstyp och pälskvalitet, kroppsform, om det hade haka eller inte, samt hälsotillstånd.
Det var organisatörernas sätt att bevara ett fullständigt vittnesbörd om varje pälsig själ som kom in i hallen.
Organisatörerna vill veta hur många av honorna som förts till mässan hade hängande öron och bar den ädla nyansen havana. Resultatet ska du bestämma baserat på testdatauppsättningen (test_data.csv).
Inget komplicerat, du behöver bara göra en noggrann sökning genom registren för att ge dem detta svar.
![]() | ![]() | ![]() |
En kylig morgon, när andedräktens ånga fortfarande steg i hallen, upptäckte organisatörerna att en viktig sida försvunnit från det officiella registret.
Rasen för varje kanin, så noggrant antecknad under andra år, fanns inte längre någonstans.
Exemplar från tre olika raser hade förts dit, det visste man säkert, men tecknen som identifierade dem direkt hade försvunnit.
De som kände kaniner väl ombads att tålmodigt observera alla exemplar och identifiera tre naturliga grupper, genom att endast använda de antecknade egenskaperna: likheter, skillnader, tydliga gränser, områden där djuren verkade närliggande eller avlägsna i utseende. Resultatet ska du bestämma baserat på testdatauppsättningen (test_data.csv).
För att utvärdera hur väl indelningarna i raser stämmer överens används Adjusted Rand Index (ARI), som mäter likheten mellan de två indelningarna och justerar för slumpmässig överensstämmelse.
ARI-koefficienten för två indelningar definieras som:
där:
RI representerar Rand-indexet mellan de två indelningarna;E[RI] är det förväntade värdet av Rand-indexet för slumpmässiga indelningar.Om det erhållna talet är nära 1, betydde det att indelningen i raser gjorts med skicklighet och gränserna mellan rasernas egenskaper identifierats korrekt. Mässans organisatörer är mycket krävande och ger full poäng för denna subtask endast om värdet som erhålls för utvärderingsmåttet är 1.
Under den december var antalet deltagare så stort att domarna, hur mycket de än ansträngde sig, inte kunde bedöma alla djur.
Endast en del av dem hade fått en Bedömningspoäng, mellan 0 och 100.
0 betyder att exemplaret diskvalificerats100 betyder att exemplaret är ett som kan utropas till mästareFör de andra kaninerna, ännu inte markerade, behövde man hitta ett sätt att gissa poängen de skulle ha fått.
Man strävade efter ett system som kunde förstå sambanden mellan redan bedömda kaniner och de som lämnats utan poäng, så att uppskattningarna skulle vara så nära som möjligt det domarna skulle ha sagt.
Ju mindre skillnaderna är, desto mer skickligt och lämpligt anses systemet för att hjälpa människor som överväldigs av det stora antalet djur.
Er uppgift är att utveckla ett automatiskt system för att förutsäga poäng för exemplaren som ingår i test_data.csv.
För att utvärdera modellens prestanda använder vi MSE (Mean Squared Error) — medelkvadratfelet. Detta mäter den genomsnittliga kvadratiska skillnaden mellan verkliga och förutsagda värden.
Formeln är:
där:
y_i är den verkliga poängen för exemplar i,y^_i är den av modellen förutsagda poängen,n är det totala antalet exemplar i testuppsättningen.Lägre MSE-värden indikerar bättre prestanda. Ju närmare de förutsagda värdena är de verkliga, desto mindre blir felet.
För att omvandla den erhållna poängen till poäng använder vi en enkel regel, baserad på två trösklar:
Det slutliga resultatet ska vara en CSV-fil med namnet output.csv, som ska innehålla exakt 3 kolumner:
subtaskID - representerar subtask-numret (1, 2, 3)datapointID - som refererar till kolumnen ID från datasetetanswer - svaret som motsvarar datapunkten för respektive subtaskObs: För subtask 1, där ett enda svar efterfrågas för hela testdatauppsättningen, visa en enda rad vars datapointID ska vara 1.
Vi ber er att engagera er och hjälpa organisatörerna av Nationella kaninmässan: en berättelse om passion och prestanda, förståelse mellan uppfödare, likheter och skillnader mellan raser och om försöket att se djurens värld med det tålamod som endast en god uppfödare kan ha inför högtiderna.