Difficoltà
Il tuo miglior punteggio
N/D
Un istituto medico desidera sviluppare un sistema automatizzato che aiuti nell'
identificazione dei pazienti a rischio di Alzheimer, utilizzando dati clinici,
demografici e comportamentali.
Hai ricevuto un set di dati con pazienti valutati clinicamente, e l'obiettivo è costruire
un modello di classificazione binaria che possa predire la diagnosi per nuovi pazienti.
Ti sono stati messi a disposizione i seguenti file:
Obiettivo principale: predizione della probabilità che un paziente sia diagnosticato con Alzheimer
(valore tra 0 e 1, dove 0 = paziente sano, 1 = paziente con Alzheimer).
Ogni riga rappresenta un paziente e contiene i seguenti attributi:
PatientID – identificatore unico del pazienteAge – età del pazienteGender – sesso (0 = femminile, 1 = maschile)Ethnicity – etnia del paziente (valori codificati numericamente)EducationLevel – livello educativo (codificato numericamente)BMI – indice di massa corporeaSmoking – fumatore (1) / non fumatore (0)AlcoholConsumption – consumo di alcolPhysicalActivity – livello di attività fisicaDietQuality – qualità della dietaSleepQuality – qualità del sonnoFamilyHistoryAlzheimers – storia familiare di AlzheimerCardiovascularDisease – malattie cardiovascolariDiabetes – diabeteDepression – depressioneHeadInjury – traumi craniciHypertension – ipertensioneSystolicBP, DiastolicBP – pressione arteriosaCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – punteggio Mini-Mental State ExaminationFunctionalAssessment – valutazione funzionaleADL – attività quotidianeMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – solo in train.csv
1 = diagnosi Alzheimer0 = senza AlzheimerObiettivo finale: predire Diagnosis per le righe in test.csv.
I primi due subtask verificano l'analisi esplorativa dei dati.
L'ultimo subtask valuta le prestazioni del modello di classificazione.
Calcola per ogni paziente in test.csv quanti pazienti ci sono nel set di addestramento (train.csv) che hanno la stessa età del paziente nel set di test.
Visualizza nel file di submission un numero naturale (secondo il formato presentato di seguito).
Per ogni paziente in test.csv, determina la percentuale di pazienti fumatori
(Smoking = 1) dal set di addestramento (train.csv) che hanno la stessa età
del paziente rispettivo.
Formula di calcolo per un paziente con età v:
(numero pazienti fumatori da train con Age = v) /(numero totale pazienti da train con Age = v) * 100Visualizza nel file di submission un numero reale tra 0 e 100,
con massimo 2 decimali, per ogni paziente.
Se nel set di addestramento non esiste nessun paziente con quell'età,
il valore visualizzato sarà 0.
Costruisci un modello di classificazione che predice la probabilità di diagnosi Alzheimer
(p ∈ [0,1]) per ogni paziente in test.csv.
La valutazione si fa usando ROC Curve e AUC (Area Under the ROC Curve).
I subtask 1–2 si valutano esattamente (per confronto).
Il file submission.csv deve contenere 3 righe per ogni paziente in test,
corrispondenti ai 3 subtask.
Struttura:
subtaskID, datapointID, answerdove:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Per il Subtask 3, la valutazione si fa usando ROC AUC (Area Under the ROC Curve),
una metrica standard per problemi di classificazione binaria.