Sværhedsgrad
Din bedste score
N/A
Et medicinsk institut ønsker at udvikle et automatiseret system, der kan hjælpe med
identifikation af patienter med risiko for Alzheimer, ved brug af kliniske,
demografiske og adfærdsmæssige data.
Du har modtaget et datasæt med klinisk evaluerede patienter, og formålet er at bygge
en binær klassifikationsmodel, der kan forudsige diagnosen for nye patienter.
Du har fået følgende filer til rådighed:
Hovedformål: forudsigelse af sandsynligheden for at en patient bliver diagnosticeret med Alzheimer
(værdi mellem 0 og 1, hvor 0 = rask patient, 1 = patient med Alzheimer).
Hver række repræsenterer en patient og indeholder følgende attributter:
PatientID – unik identifikator for patientenAge – patientens alderGender – køn (0 = kvindelig, 1 = mandlig)Ethnicity – patientens etnicitet (numerisk kodede værdier)EducationLevel – uddannelsesniveau (numerisk kodet)BMI – kropsmasseindeksSmoking – ryger (1) / ikke-ryger (0)AlcoholConsumption – alkoholforbrugPhysicalActivity – niveau af fysisk aktivitetDietQuality – diætens kvalitetSleepQuality – søvnkvalitetFamilyHistoryAlzheimers – familiehistorie med AlzheimerCardiovascularDisease – kardiovaskulære sygdommeDiabetes – diabetesDepression – depressionHeadInjury – hovedtraumerHypertension – hypertensionSystolicBP, DiastolicBP – blodtrykCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – Mini-Mental State Examination scoreFunctionalAssessment – funktionel evalueringADL – daglige aktiviteterMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – kun i train.csv
1 = Alzheimer-diagnose0 = ingen AlzheimerEndeligt mål: forudsig Diagnosis for rækkerne i test.csv.
De første to subtasks verificerer eksplorativ dataanalyse.
Den sidste subtask evaluerer klassifikationsmodellens ydeevne.
Beregn for hver patient i test.csv hvor mange patienter der er i træningssættet (train.csv), som har samme alder som patienten i testsættet.
Vis i indsendelsesfilen et naturligt tal (i henhold til formatet præsenteret nedenfor).
For hver patient i test.csv, bestem procentdelen af rygerpatienter
(Smoking = 1) fra træningssættet (train.csv) som har samme alder
som den pågældende patient.
Beregningsformel for en patient med alder v:
(antal rygerpatienter fra train med Age = v) /(samlet antal patienter fra train med Age = v) * 100Vis i indsendelsesfilen et reelt tal mellem 0 og 100,
med maksimalt 2 decimaler, for hver patient.
Hvis der ikke findes nogen patient med den pågældende alder i træningssættet,
vil den viste værdi være 0.
Byg en klassifikationsmodel, der forudsiger sandsynligheden for Alzheimer-diagnose
(p ∈ [0,1]) for hver patient i test.csv.
Evalueringen foretages ved brug af ROC Curve og AUC (Area Under the ROC Curve).
Subtasks 1–2 evalueres nøjagtigt (ved sammenligning).
Filen submission.csv skal indeholde 3 linjer for hver patient i test,
svarende til de 3 subtasks.
Struktur:
subtaskID, datapointID, answerhvor:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873For Subtask 3 foretages evalueringen ved brug af ROC AUC (Area Under the ROC Curve),
en standardmetrik for binære klassifikationsproblemer.