Moeilijkheid
Jouw beste score
N.v.t.
Een medisch instituut wil een geautomatiseerd systeem ontwikkelen dat helpt bij
identificatie van patiënten met Alzheimer-risico, gebruikmakend van klinische,
demografische en gedragsgegevens.
Je hebt een dataset ontvangen met klinisch geëvalueerde patiënten, en het doel is om
een binair classificatiemodel te bouwen dat de diagnose voor nieuwe patiënten kan voorspellen.
De volgende bestanden zijn ter beschikking gesteld:
Hoofddoel: voorspelling van de waarschijnlijkheid dat een patiënt wordt gediagnosticeerd met Alzheimer
(waarde tussen 0 en 1, waarbij 0 = gezonde patiënt, 1 = patiënt met Alzheimer).
Elke rij vertegenwoordigt een patiënt en bevat de volgende attributen:
PatientID – unieke identificator van de patiëntAge – leeftijd van de patiëntGender – geslacht (0 = vrouwelijk, 1 = mannelijk)Ethnicity – etniciteit van de patiënt (numeriek gecodeerde waarden)EducationLevel – opleidingsniveau (numeriek gecodeerd)BMI – body mass indexSmoking – roker (1) / niet-roker (0)AlcoholConsumption – alcoholconsumptiePhysicalActivity – niveau van fysieke activiteitDietQuality – kwaliteit van het dieetSleepQuality – slaapkwaliteitFamilyHistoryAlzheimers – familiegeschiedenis AlzheimerCardiovascularDisease – cardiovasculaire ziektenDiabetes – diabetesDepression – depressieHeadInjury – hoofdtrauma'sHypertension – hypertensieSystolicBP, DiastolicBP – bloeddrukCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – Mini-Mental State Examination scoreFunctionalAssessment – functionele evaluatieADL – dagelijkse activiteitenMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – alleen in train.csv
1 = Alzheimer diagnose0 = geen AlzheimerEinddoel: voorspel Diagnosis voor de rijen in test.csv.
De eerste twee subtaken controleren de exploratieve data-analyse.
De laatste subtaak evalueert de prestatie van het classificatiemodel.
Bereken voor elke patiënt in test.csv hoeveel patiënten er in de trainingsset (train.csv) zijn die dezelfde leeftijd hebben als de patiënt in de testset.
Toon in het inzendingsbestand een natuurlijk getal (volgens het hieronder gepresenteerde formaat).
Voor elke patiënt in test.csv, bepaal het percentage rokende patiënten
(Smoking = 1) uit de trainingsset (train.csv) die dezelfde leeftijd hebben
als de betreffende patiënt.
Berekeningsformule voor een patiënt met leeftijd v:
(aantal rokende patiënten uit train met Age = v) /(totaal aantal patiënten uit train met Age = v) * 100Toon in het inzendingsbestand een reëel getal tussen 0 en 100,
met maximaal 2 decimalen, voor elke patiënt.
Als er in de trainingsset geen enkele patiënt bestaat met die leeftijd,
zal de getoonde waarde 0 zijn.
Bouw een classificatiemodel dat de waarschijnlijkheid van Alzheimer diagnose
(p ∈ [0,1]) voorspelt voor elke patiënt in test.csv.
De evaluatie wordt gedaan met behulp van ROC Curve en AUC (Area Under the ROC Curve).
Subtaken 1–2 worden exact geëvalueerd (door vergelijking).
Het bestand submission.csv moet 3 regels bevatten voor elke patiënt in test,
overeenkomend met de 3 subtaken.
Structuur:
subtaskID, datapointID, answerwaarbij:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Voor Subtaak 3 wordt de evaluatie gedaan met behulp van ROC AUC (Area Under the ROC Curve),
een standaardmetriek voor binaire classificatieproblemen.