Difficoltà
Il tuo miglior punteggio
N/D
In un mese di dicembre con fiocchi grandi e silenziosi, quando il villaggio profumava ancora di legna bruciata e di fieno fresco tirato fuori dai fienili, nel centro del paese si aprivano le porte dell'Esposizione Nazionale dei Conigli. Nei padiglioni riscaldati, splendenti sotto le luci gialle, allevatori da tutti gli angoli del paese portavano con speranza gli animali più belli e meglio curati.

Esemplari di tre grandi razze di conigli (ciascuna con aspetto e abitudini ben radicate) dovevano incontrarsi di nuovo nello stesso luogo.
Ogni animale riceveva una targhetta con un ID, e in un registro spesso, rilegato in pelle, venivano annotati tutti i segni che lo distinguevano dagli altri:
sesso, peso, lunghezza delle orecchie, se le orecchie erano cadenti o no, colore del pelo, età, tipo e qualità del pelo, forma del corpo, se aveva o no la giogaia, così come lo stato di salute.
Era il modo degli organizzatori di conservare una testimonianza completa di ogni anima pelosa entrata nel padiglione.
Gli organizzatori desiderano sapere quante tra le femmine portate all'esposizione avevano orecchie cadenti e portavano la nobile sfumatura havana. Il risultato deve essere determinato sulla base del set di test (test_data.csv).
Niente di complicato, devi solo realizzare una ricerca attenta attraverso i registri per offrire loro questa risposta.
![]() | ![]() | ![]() |
In una mattina fredda, il vapore del respiro si alzava ancora nel padiglione, e gli organizzatori scoprirono che una pagina importante era scomparsa dal registro ufficiale.
La razza di ogni coniglio, annotata così attentamente negli altri anni, non si trovava più da nessuna parte.
Erano stati portati esemplari di tre razze diverse, questo si sapeva con certezza, ma i segni che li identificavano direttamente erano scomparsi.
Coloro che conoscevano bene i conigli furono pregati di osservare con pazienza tutti gli esemplari e di identificare tre gruppi naturali, usando solo le caratteristiche annotate: somiglianze, differenze, limiti chiari, zone dove gli animali sembravano vicini o lontani come aspetto. Il risultato deve essere determinato sulla base del set di test (test_data.csv).
Per valutare quanto bene si adattano le divisioni in razze, si usa l'Adjusted Rand Index (ARI), che misura la similarità tra le due divisioni, aggiustando per la corrispondenza casuale.
Il coefficiente ARI per due divisioni è definito come:
dove:
RI rappresenta l'indice Rand tra le due divisioni;E[RI] è il valore atteso dell'indice Rand per divisioni casuali.Se il numero ottenuto è vicino a 1, significava che la divisione in razze era stata fatta con competenza e i limiti tra le caratteristiche delle razze erano stati identificati correttamente. Gli organizzatori dell'esposizione sono molto esigenti e offrono il punteggio massimo per questo subtask solo se il valore ottenuto per la metrica di valutazione è 1.
In quel dicembre, il numero di partecipanti era stato così grande che i giudici, per quanto si fossero sforzati, non erano riusciti a giudicare tutti gli animali.
Solo una parte di essi aveva ricevuto un Punteggio di Giuria, tra 0 e 100.
0 significa che l'esemplare è stato squalificato100 significa che l'esemplare è uno che può essere dichiarato campionePer gli altri conigli, non ancora valutati, bisognava trovare un modo per indovinare il punteggio che avrebbero ricevuto.
Si cercava un sistema capace di comprendere i legami tra i conigli già valutati e quelli rimasti senza punteggio, in modo che le stime fossero il più vicino possibile a quello che avrebbero detto i giudici.
Quanto minori sono le differenze, tanto più il sistema è considerato abile e adatto ad aiutare le persone sopraffatte dal grande numero di animali.
Il vostro compito è sviluppare un sistema automatico di predizione dei punteggi per gli esemplari inclusi in test_data.csv.
Per la valutazione delle prestazioni del modello usiamo MSE (Mean Squared Error) — l'errore quadratico medio. Questo misura la differenza media quadratica tra i valori reali e i valori previsti.
La formula è:
dove:
y_i è il punteggio reale dell'esemplare i,y^_i è il punteggio previsto dal modello,n è il numero totale di esemplari nel set di test.Valori più bassi di MSE indicano una prestazione migliore. Quanto più i valori previsti sono vicini a quelli reali, tanto minore sarà l'errore.
Per trasformare il punteggio ottenuto in punteggio finale, usiamo una regola semplice, basata su due soglie:
Il risultato finale deve essere un file CSV chiamato output.csv, che deve contenere esattamente 3 colonne:
subtaskID - rappresenta il numero del subtask (1, 2, 3)datapointID - che si riferisce alla colonna ID del datasetanswer - la risposta corrispondente al datapoint per il rispettivo subtaskNota: Per il subtask 1, per il quale si chiede una sola risposta per tutto il set di dati di test, visualizzate una sola riga il cui datapointID sia 1.
Vi preghiamo di impegnarvi e aiutare gli organizzatori dell'Esposizione Nazionale dei Conigli: una storia di passione e prestazione, comprensione tra allevatori, somiglianze e differenze tra razze e del tentativo di vedere il mondo degli animali con quella pazienza che solo un buon allevatore può avere alla vigilia delle feste.