Raskusaste
Sinu parim tulemus
Puudub
Meditsiiniinstituut soovib arendada automatiseeritud süsteemi, mis aitaks
tuvastada Alzheimeri riskiga patsiente, kasutades kliinilisi,
demograafilisi ja käitumuslikke andmeid.
Oled saanud andmestiku kliiniliselt hinnatud patsientidega ning eesmärk on ehitada
binaarse klassifikatsiooni mudel, mis suudab ennustada diagnoosi uutele patsientidele.
Sulle on antud järgmised failid:
Peamine eesmärk: tõenäosuse ennustamine, et patsiendil diagnoositakse Alzheimer
(väärtus 0 ja 1 vahel, kus 0 = terve patsient, 1 = Alzheimeriga patsient).
Iga rida esindab ühte patsienti ja sisaldab järgmisi atribuute:
PatientID – patsiendi unikaalne identifikaatorAge – patsiendi vanusGender – sugu (0 = naissoost, 1 = meessoost)Ethnicity – patsiendi etniline kuuluvus (numbriliselt kodeeritud väärtused)EducationLevel – haridustase (numbriliselt kodeeritud)BMI – kehamassiindeksSmoking – suitsetaja (1) / mittesuitsetaja (0)AlcoholConsumption – alkoholi tarbiminePhysicalActivity – füüsilise aktiivsuse taseDietQuality – dieedi kvaliteetSleepQuality – une kvaliteetFamilyHistoryAlzheimers – Alzheimeri perekondlik ajaluguCardiovascularDisease – südame-veresoonkonna haigusedDiabetes – diabeetDepression – depressioonHeadInjury – peatraumadHypertension – hüpertensioonSystolicBP, DiastolicBP – vererõhkCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – Mini-Mental State Examination skoorFunctionalAssessment – funktsionaalne hinnangADL – igapäevased tegevusedMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – ainult train.csv-s
1 = Alzheimeri diagnoos0 = AlzheimeritaLõppeesmärk: ennusta Diagnosis ridade jaoks test.csv-s.
Esimesed kaks alamülesannet kontrollivad andmete uurivat analüüsi.
Viimane alamülesanne hindab klassifikatsioonimudeli jõudlust.
Arvuta iga test.csv patsiendi jaoks, mitu patsienti on treeningkomplektis (train.csv), kellel on sama vanus kui testkomplekti patsiendil.
Kuva esitamisfailis naturaalarv (vastavalt allpool esitatud formaadile).
Iga test.csv patsiendi jaoks määra suitsetavate patsientide protsent
(Smoking = 1) treeningkomplektist (train.csv) kellel on sama vanus
kui vastaval patsiendil.
Arvutusvalem patsiendi jaoks vanusega v:
(suitsetavate patsientide arv train-is Age = v-ga) /(patsientide koguarv train-is Age = v-ga) * 100Kuva esitamisfailis reaalarv 0 ja 100 vahel,
kuni 2 kümnendkohaga, iga patsiendi jaoks.
Kui treeningkomplektis ei ole ühtegi patsienti vastava vanusega,
on kuvatud väärtus 0.
Ehita klassifikatsioonimudel, mis ennustab Alzheimeri diagnoosi tõenäosust
(p ∈ [0,1]) iga test.csv patsiendi jaoks.
Hindamine toimub kasutades ROC kõverat ja AUC (Area Under the ROC Curve).
Alamülesanded 1–2 hinnatakse täpselt (võrdlemise teel).
Fail submission.csv peab sisaldama 3 rida iga testi patsiendi jaoks,
mis vastavad 3 alamülesandele.
Struktuur:
subtaskID, datapointID, answerkus:
PatientID väärtusPatientID = 4751 jaoks:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Alamülesande 3 jaoks toimub hindamine kasutades ROC AUC (Area Under the ROC Curve),
mis on standardne meetrika binaarse klassifikatsiooni probleemide jaoks.