Težavnost
Vaš najboljši rezultat
N/A
Medicinski inštitut želi razviti avtomatiziran sistem, ki bo pomagal pri
identifikaciji pacientov z tveganjem za Alzheimerjevo bolezen, z uporabo kliničnih,
demografskih in vedenjskih podatkov.
Prejeli ste nabor podatkov s klinično ocenjenimi pacienti, cilj pa je zgraditi
model binarne klasifikacije, ki bo lahko napovedal diagnozo za nove paciente.
Na voljo imate naslednje datoteke:
Glavni cilj: napoved verjetnosti, da bo pacient diagnosticiran z Alzheimerjevo boleznijo
(vrednost med 0 in 1, kjer 0 = zdrav pacient, 1 = pacient z Alzheimerjevo boleznijo).
Vsaka vrstica predstavlja pacienta in vsebuje naslednje atribute:
PatientID – edinstveni identifikator pacientaAge – starost pacientaGender – spol (0 = ženski, 1 = moški)Ethnicity – etničnost pacienta (numerično kodirane vrednosti)EducationLevel – izobrazbena raven (numerično kodirana)BMI – indeks telesne maseSmoking – kadilec (1) / nekadilec (0)AlcoholConsumption – uživanje alkoholaPhysicalActivity – raven fizične aktivnostiDietQuality – kakovost prehraneSleepQuality – kakovost spanjaFamilyHistoryAlzheimers – družinska anamneza Alzheimerjeve bolezniCardiovascularDisease – kardiovaskularne bolezniDiabetes – sladkorna bolezenDepression – depresijaHeadInjury – poškodbe glaveHypertension – hipertenzijaSystolicBP, DiastolicBP – krvni tlakCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – ocena Mini-Mental State ExaminationFunctionalAssessment – funkcionalna ocenaADL – dnevne aktivnostiMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – samo v train.csv
1 = diagnoza Alzheimerjeve bolezni0 = brez Alzheimerjeve bolezniKončni cilj: napovedati Diagnosis za vrstice v test.csv.
Prvi dve podnalogi preverjata raziskovalno analizo podatkov.
Zadnja podnaloga ocenjuje uspešnost klasifikacijskega modela.
Izračunaj za vsakega pacienta iz test.csv, koliko pacientov je v učnem naboru (train.csv), ki imajo enako starost kot pacient iz testnega nabora.
V datoteki za oddajo prikaži naravno število (v skladu s spodaj predstavljenim formatom).
Za vsakega pacienta iz test.csv določi odstotek kadilskih pacientov
(Smoking = 1) iz učnega nabora (train.csv) ki imajo enako starost
kot zadevni pacient.
Formula za izračun za pacienta s starostjo v:
(število kadilskih pacientov iz train z Age = v) /(skupno število pacientov iz train z Age = v) * 100V datoteki za oddajo prikaži realno število med 0 in 100,
z največ 2 decimalnima mestoma, za vsakega pacienta.
Če v učnem naboru ne obstaja noben pacient z zadevno starostjo,
bo prikazana vrednost 0.
Zgradi klasifikacijski model, ki napoveduje verjetnost diagnoze Alzheimerjeve bolezni
(p ∈ [0,1]) za vsakega pacienta iz test.csv.
Ocenjevanje se izvaja z uporabo ROC krivulje in AUC (Area Under the ROC Curve).
Podnalogi 1–2 se ocenjujeta natančno (s primerjavo).
Datoteka submission.csv mora vsebovati 3 vrstice za vsakega pacienta iz testa,
ki ustrezajo 3 podnalogram.
Struktura:
subtaskID, datapointID, answerkjer:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Za Podnaloga 3 se ocenjevanje izvaja z uporabo ROC AUC (Area Under the ROC Curve),
standardne metrike za probleme binarne klasifikacije.