Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Medicīnas institūts vēlas izstrādāt automatizētu sistēmu, kas palīdzētu
identificēt pacientus ar Alcheimera risku, izmantojot klīniskos,
demogrāfiskos un uzvedības datus.
Tu esi saņēmis datu kopu ar klīniski novērtētiem pacientiem, un mērķis ir izveidot
binārās klasifikācijas modeli, kas spētu prognozēt diagnozi jauniem pacientiem.
Tev ir nodoti šādi faili:
Galvenais mērķis: varbūtības prognozēšana, ka pacientam tiks diagnosticēts Alcheimers
(vērtība starp 0 un 1, kur 0 = vesels pacients, 1 = pacients ar Alcheimeru).
Katra rinda attēlo pacienti un satur šādus atribūtus:
PatientID – unikāls pacienta identifikatorsAge – pacienta vecumsGender – dzimums (0 = sievišķais, 1 = vīrišķais)Ethnicity – pacienta etniskā piederība (skaitliski kodētas vērtības)EducationLevel – izglītības līmenis (skaitliski kodēts)BMI – ķermeņa masas indekssSmoking – smēķētājs (1) / nesmēķētājs (0)AlcoholConsumption – alkohola patēriņšPhysicalActivity – fiziskās aktivitātes līmenisDietQuality – diētas kvalitāteSleepQuality – miega kvalitāteFamilyHistoryAlzheimers – Alcheimera ģimenes anamnēzeCardiovascularDisease – kardiovaskulārās slimībasDiabetes – diabētsDepression – depresijaHeadInjury – galvas traumasHypertension – hipertensijaSystolicBP, DiastolicBP – asinsspiediensCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – Mini-Mental State Examination rezultātsFunctionalAssessment – funkcionālais novērtējumsADL – ikdienas aktivitātesMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – tikai train.csv
1 = Alcheimera diagnoze0 = bez AlcheimeraGalīgais mērķis: prognozēt Diagnosis rindām no test.csv.
Pirmie divi apakšuzdevumi pārbauda izpētes datu analīzi.
Pēdējais apakšuzdevums novērtē klasifikācijas modeļa veiktspēju.
Aprēķini katram pacientam no test.csv, cik pacienti ir apmācības kopā (train.csv), kuriem ir tāds pats vecums kā testa kopas pacientam.
Parādi iesniegšanas failā naturālu skaitli (saskaņā ar zemāk norādīto formātu).
Katram pacientam no test.csv nosaki smēķētāju pacientu procentu
(Smoking = 1) no apmācības kopas (train.csv) kuriem ir tāds pats vecums
kā attiecīgajam pacientam.
Aprēķina formula pacientam ar vecumu v:
(smēķētāju pacienti no train ar Age = v) /(kopējais pacienti no train ar Age = v) * 100Parādi iesniegšanas failā reālu skaitli starp 0 un 100,
ar maksimāli 2 decimālzīmēm katram pacientam.
Ja apmācības kopā nav neviena pacienta ar attiecīgo vecumu,
parādītā vērtība būs 0.
Izveido klasifikācijas modeli, kas prognozē Alcheimera diagnozes varbūtību
(p ∈ [0,1]) katram pacientam no test.csv.
Novērtēšana tiek veikta, izmantojot ROC Curve un AUC (Area Under the ROC Curve).
Apakšuzdevumi 1–2 tiek novērtēti precīzi (salīdzinot).
Failam submission.csv jāsatur 3 rindas katram pacientam no testa,
kas atbilst 3 apakšuzdevumiem.
Struktūra:
subtaskID, datapointID, answerkur:
PatientID vērtībaPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Apakšuzdevumam 3 novērtēšana tiek veikta, izmantojot ROC AUC (Area Under the ROC Curve),
standarta metriku binārās klasifikācijas problēmām.