Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Ett medicinskt institut vill utveckla ett automatiserat system som hjälper till med
identifiering av patienter med risk för Alzheimer, genom att använda kliniska,
demografiska och beteendemässiga data.
Du har fått en dataset med kliniskt utvärderade patienter, och målet är att bygga
en binär klassificeringsmodell som kan förutsäga diagnosen för nya patienter.
Du har fått tillgång till följande filer:
Huvudmål: förutsägelse av sannolikheten att en patient diagnostiseras med Alzheimer
(värde mellan 0 och 1, där 0 = frisk patient, 1 = patient med Alzheimer).
Varje rad representerar en patient och innehåller följande attribut:
PatientID – unik identifierare för patientenAge – patientens ålderGender – kön (0 = kvinnligt, 1 = manligt)Ethnicity – patientens etnicitet (numeriskt kodade värden)EducationLevel – utbildningsnivå (numeriskt kodad)BMI – kroppsmasseindexSmoking – rökare (1) / icke-rökare (0)AlcoholConsumption – alkoholkonsumtionPhysicalActivity – nivå av fysisk aktivitetDietQuality – dietkvalitetSleepQuality – sömnkvalitetFamilyHistoryAlzheimers – familjehistoria av AlzheimerCardiovascularDisease – kardiovaskulära sjukdomarDiabetes – diabetesDepression – depressionHeadInjury – huvudtraumaHypertension – hypertensionSystolicBP, DiastolicBP – blodtryckCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – Mini-Mental State Examination poängFunctionalAssessment – funktionell utvärderingADL – dagliga aktiviteterMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – endast i train.csv
1 = Alzheimer-diagnos0 = utan AlzheimerSlutmål: förutsäg Diagnosis för raderna i test.csv.
De första två deluppgifterna kontrollerar explorativ dataanalys.
Den sista deluppgiften utvärderar klassificeringsmodellens prestanda.
Beräkna för varje patient i test.csv hur många patienter som finns i träningssetet (train.csv) som har samma ålder som patienten i testsetet.
Visa i inlämningsfilen ett naturligt tal (enligt formatet som presenteras nedan).
För varje patient i test.csv, bestäm procentandelen rökande patienter
(Smoking = 1) från träningssetet (train.csv) som har samma ålder
som respektive patient.
Beräkningsformel för en patient med ålder v:
(antal rökande patienter från train med Age = v) /(totalt antal patienter från train med Age = v) * 100Visa i inlämningsfilen ett reellt tal mellan 0 och 100,
med högst 2 decimaler, för varje patient.
Om det inte finns någon patient med respektive ålder i träningssetet,
ska det visade värdet vara 0.
Bygg en klassificeringsmodell som förutsäger sannolikheten för Alzheimer-diagnos
(p ∈ [0,1]) för varje patient i test.csv.
Utvärderingen görs med ROC Curve och AUC (Area Under the ROC Curve).
Deluppgifterna 1–2 utvärderas exakt (genom jämförelse).
Filen submission.csv ska innehålla 3 rader för varje patient i test,
motsvarande de 3 deluppgifterna.
Struktur:
subtaskID, datapointID, answerdär:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873För Deluppgift 3 görs utvärderingen med ROC AUC (Area Under the ROC Curve),
ett standardmått för binära klassificeringsproblem.