Vanskelighetsgrad
Din beste poengsum
N/A
Et medisinsk institutt ønsker å utvikle et automatisert system som skal hjelpe til med
identifisering av pasienter med risiko for Alzheimer, ved bruk av kliniske,
demografiske og atferdsmessige data.
Du har fått et datasett med klinisk evaluerte pasienter, og målet er å bygge
en binær klassifikasjonsmodell som kan predikere diagnosen for nye pasienter.
Du har fått tilgang til følgende filer:
Hovedmål: prediksjon av sannsynligheten for at en pasient blir diagnostisert med Alzheimer
(verdi mellom 0 og 1, hvor 0 = frisk pasient, 1 = pasient med Alzheimer).
Hver rad representerer en pasient og inneholder følgende attributter:
PatientID – unik identifikator for pasientenAge – pasientens alderGender – kjønn (0 = kvinnelig, 1 = mannlig)Ethnicity – pasientens etnisitet (numerisk kodede verdier)EducationLevel – utdanningsnivå (numerisk kodet)BMI – kroppsmasseindeksSmoking – røyker (1) / ikke-røyker (0)AlcoholConsumption – alkoholforbrukPhysicalActivity – nivå av fysisk aktivitetDietQuality – kvalitet på kostholdSleepQuality – søvnkvalitetFamilyHistoryAlzheimers – familiehistorie med AlzheimerCardiovascularDisease – hjerte-kar-sykdommerDiabetes – diabetesDepression – depresjonHeadInjury – hodeskaderHypertension – hypertensjonSystolicBP, DiastolicBP – blodtrykkCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – Mini-Mental State Examination-skårFunctionalAssessment – funksjonell evalueringADL – daglige aktiviteterMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – kun i train.csv
1 = Alzheimer-diagnose0 = uten AlzheimerEndelig mål: prediker Diagnosis for radene i test.csv.
De første to deloppgavene verifiserer utforskende dataanalyse.
Den siste deloppgaven evaluerer ytelsen til klassifikasjonsmodellen.
Beregn for hver pasient i test.csv hvor mange pasienter som finnes i treningssettet (train.csv) som har samme alder som pasienten i testsettet.
Vis i innleveringsfilen et naturlig tall (i henhold til formatet presentert nedenfor).
For hver pasient i test.csv, bestem prosentandelen av røykende pasienter
(Smoking = 1) fra treningssettet (train.csv) som har samme alder
som den respektive pasienten.
Beregningsformel for en pasient med alder v:
(antall røykende pasienter fra train med Age = v) /(totalt antall pasienter fra train med Age = v) * 100Vis i innleveringsfilen et reelt tall mellom 0 og 100,
med maksimalt 2 desimaler, for hver pasient.
Hvis det ikke finnes noen pasient med den respektive alderen i treningssettet,
vil den viste verdien være 0.
Bygg en klassifikasjonsmodell som predikerer sannsynligheten for Alzheimer-diagnose
(p ∈ [0,1]) for hver pasient i test.csv.
Evalueringen gjøres ved bruk av ROC Curve og AUC (Area Under the ROC Curve).
Deloppgavene 1–2 evalueres nøyaktig (ved sammenligning).
Filen submission.csv må inneholde 3 linjer for hver pasient i test,
tilsvarende de 3 deloppgavene.
Struktur:
subtaskID, datapointID, answerhvor:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873For Deloppgave 3 gjøres evalueringen ved bruk av ROC AUC (Area Under the ROC Curve),
en standard metrikk for binære klassifikasjonsproblemer.