Obtížnost
Vaše nejlepší skóre
N/A
Lékařský institut si přeje vyvinout automatizovaný systém, který by pomáhal při
identifikaci pacientů s rizikem Alzheimerovy choroby, pomocí klinických,
demografických a behaviorálních dat.
Obdržel jsi dataset s klinicky vyhodnocenými pacienty a cílem je vybudovat
model binární klasifikace, který by dokázal predikovat diagnózu pro nové pacienty.
K dispozici máš následující soubory:
Hlavní cíl: predikce pravděpodobnosti, že bude u pacienta diagnostikována Alzheimerova choroba
(hodnota mezi 0 a 1, kde 0 = zdravý pacient, 1 = pacient s Alzheimerovou chorobou).
Každý řádek představuje pacienta a obsahuje následující atributy:
PatientID – jedinečný identifikátor pacientaAge – věk pacientaGender – pohlaví (0 = ženské, 1 = mužské)Ethnicity – etnicita pacienta (numericky kódované hodnoty)EducationLevel – úroveň vzdělání (numericky kódováno)BMI – index tělesné hmotnostiSmoking – kuřák (1) / nekuřák (0)AlcoholConsumption – konzumace alkoholuPhysicalActivity – úroveň fyzické aktivityDietQuality – kvalita stravySleepQuality – kvalita spánkuFamilyHistoryAlzheimers – rodinná anamnéza Alzheimerovy chorobyCardiovascularDisease – kardiovaskulární onemocněníDiabetes – diabetesDepression – depreseHeadInjury – poranění hlavyHypertension – hypertenzeSystolicBP, DiastolicBP – krevní tlakCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – skóre Mini-Mental State ExaminationFunctionalAssessment – funkční hodnoceníADL – aktivity denního životaMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – pouze v train.csv
1 = diagnóza Alzheimerovy choroby0 = bez Alzheimerovy chorobyKonečný cíl: predikuj Diagnosis pro řádky v test.csv.
První dva podúkoly ověřují explorativní analýzu dat.
Poslední podúkol hodnotí výkon klasifikačního modelu.
Vypočítej pro každého pacienta z test.csv, kolik pacientů je v trénovací množině (train.csv), kteří mají stejný věk jako pacient z testovací množiny.
Zobraz v souboru pro odevzdání přirozené číslo (podle formátu uvedeného níže).
Pro každého pacienta z test.csv urči procento kuřáků
(Smoking = 1) z trénovací množiny (train.csv) kteří mají stejný věk
jako příslušný pacient.
Vzorec pro výpočet pro pacienta s věkem v:
(počet kuřáků z train s Age = v) /(celkový počet pacientů z train s Age = v) * 100Zobraz v souboru pro odevzdání reálné číslo mezi 0 a 100,
s maximálně 2 desetinnými místy, pro každého pacienta.
Pokud v trénovací množině neexistuje žádný pacient s příslušným věkem,
zobrazená hodnota bude 0.
Vybuduj klasifikační model, který predikuje pravděpodobnost diagnózy Alzheimerovy choroby
(p ∈ [0,1]) pro každého pacienta z test.csv.
Hodnocení se provádí pomocí ROC Curve a AUC (Area Under the ROC Curve).
Podúkoly 1–2 se hodnotí přesně (porovnáním).
Soubor submission.csv musí obsahovat 3 řádky pro každého pacienta z testu,
odpovídající 3 podúkolům.
Struktura:
subtaskID, datapointID, answerkde:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Pro Podúkol 3 se hodnocení provádí pomocí ROC AUC (Area Under the ROC Curve),
standardní metriky pro problémy binární klasifikace.