Difficulté
Votre meilleur score
N/D
Un institut médical souhaite développer un système automatisé qui aide à
identifier les patients à risque d'Alzheimer, en utilisant des données cliniques,
démographiques et comportementales.
Vous avez reçu un ensemble de données avec des patients évalués cliniquement, et l'objectif est de construire
un modèle de classification binaire qui puisse prédire le diagnostic pour de nouveaux patients.
Les fichiers suivants ont été mis à votre disposition :
Objectif principal : prédiction de la probabilité qu'un patient soit diagnostiqué avec Alzheimer
(valeur entre 0 et 1, où 0 = patient sain, 1 = patient avec Alzheimer).
Chaque ligne représente un patient et contient les attributs suivants :
PatientID – identifiant unique du patientAge – âge du patientGender – sexe (0 = féminin, 1 = masculin)Ethnicity – ethnie du patient (valeurs codées numériquement)EducationLevel – niveau d'éducation (codé numériquement)BMI – indice de masse corporelleSmoking – fumeur (1) / non-fumeur (0)AlcoholConsumption – consommation d'alcoolPhysicalActivity – niveau d'activité physiqueDietQuality – qualité du régime alimentaireSleepQuality – qualité du sommeilFamilyHistoryAlzheimers – antécédents familiaux d'AlzheimerCardiovascularDisease – maladies cardiovasculairesDiabetes – diabèteDepression – dépressionHeadInjury – traumatismes crâniensHypertension – hypertensionSystolicBP, DiastolicBP – tension artérielleCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – score Mini-Mental State ExaminationFunctionalAssessment – évaluation fonctionnelleADL – activités quotidiennesMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – uniquement dans train.csv
1 = diagnostic Alzheimer0 = sans AlzheimerObjectif final : prédire Diagnosis pour les lignes de test.csv.
Les deux premières sous-tâches vérifient l'analyse exploratoire des données.
La dernière sous-tâche évalue la performance du modèle de classification.
Calculez pour chaque patient de test.csv combien de patients sont dans l'ensemble d'entraînement (train.csv) qui ont le même âge que celui du patient de l'ensemble de test.
Affichez dans le fichier de soumission un nombre naturel (selon le format présenté ci-dessous).
Pour chaque patient de test.csv, déterminez le pourcentage de patients fumeurs
(Smoking = 1) de l'ensemble d'entraînement (train.csv) qui ont le même âge
que le patient respectif.
Formule de calcul pour un patient d'âge v :
(nombre de patients fumeurs de train avec Age = v) /(nombre total de patients de train avec Age = v) * 100Affichez dans le fichier de soumission un nombre réel entre 0 et 100,
avec au maximum 2 décimales, pour chaque patient.
Si dans l'ensemble d'entraînement il n'existe aucun patient avec l'âge respectif,
la valeur affichée sera 0.
Construisez un modèle de classification qui prédit la probabilité de diagnostic d'Alzheimer
(p ∈ [0,1]) pour chaque patient de test.csv.
L'évaluation se fait en utilisant ROC Curve et AUC (Area Under the ROC Curve).
Les sous-tâches 1–2 sont évaluées exactement (par comparaison).
Le fichier submission.csv doit contenir 3 lignes pour chaque patient de test,
correspondant aux 3 sous-tâches.
Structure :
subtaskID, datapointID, answeroù :
PatientIDPatientID = 4751 :subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Pour Sous-tâche 3, l'évaluation se fait en utilisant ROC AUC (Area Under the ROC Curve),
une métrique standard pour les problèmes de classification binaire.