Problema #22
Autore:Mihai Nan
Difficoltà
Il tuo miglior punteggio
N/D
Si desidera costruire un modello di classificazione che predica se un paziente ha il diabete basandosi su analisi del sangue e dati demografici.
Ogni paziente è caratterizzato da 8 attributi numerici ottenuti da analisi e misurazioni cliniche, mentre l'etichetta (target) indica la presenza del diabete (1 per positivo, 0 per negativo).
Questo tipo di problema appartiene alla categoria di classificazione binaria (binary classification).
pregnancies – numero di gravidanzeglucose – livello di glucosio nel sangueblood_pressure – pressione arteriosaskin_thickness – spessore della plica cutaneainsulin – livello di insulinabmi – indice di massa corporeadiabetes_pedigree_function – punteggio genetico di rischioage – età del pazientetrain.csvContiene tutte le 8 colonne di features più la colonna:
target – indica la presenza del diabete (0 o 1)Esempio:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvContiene le stesse colonne senza target, ma include SampleID.
Esempio:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
Il file di output (submission.csv) deve contenere esattamente due colonne:
SampleIDlabel – etichetta predetta dal modello (0 o 1)Esempio:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
La valutazione dei modelli verrà effettuata utilizzando la seguente metrica:
Questa metrica è adatta per la classificazione binaria, poiché accorda uguale importanza alla correttezza delle predizioni per entrambe le classi.
Formula generale:
dove:
Il punteggio finale si esprime come percentuale (0–100), arrotondato a due decimali.
Il dataset proviene dalla collezione originale:
Pima Indians Diabetes Database – Kaggle