Trudność
Twój najlepszy wynik
Nie dotyczy
Instytut medyczny chce opracować zautomatyzowany system, który pomoże w
identyfikacji pacjentów z ryzykiem Alzheimera, wykorzystując dane kliniczne,
demograficzne i behawioralne.
Otrzymałeś zestaw danych z pacjentami ocenionymi klinicznie, a celem jest zbudowanie
modelu klasyfikacji binarnej, który będzie mógł przewidzieć diagnozę dla nowych pacjentów.
Do dyspozycji otrzymałeś następujące pliki:
Główny cel: predykcja prawdopodobieństwa, że pacjent zostanie zdiagnozowany z Alzheimerem
(wartość między 0 a 1, gdzie 0 = pacjent zdrowy, 1 = pacjent z Alzheimerem).
Każdy wiersz reprezentuje pacjenta i zawiera następujące atrybuty:
PatientID – unikalny identyfikator pacjentaAge – wiek pacjentaGender – płeć (0 = żeńska, 1 = męska)Ethnicity – pochodzenie etniczne pacjenta (wartości zakodowane numerycznie)EducationLevel – poziom wykształcenia (zakodowany numerycznie)BMI – wskaźnik masy ciałaSmoking – palacz (1) / niepalacz (0)AlcoholConsumption – spożycie alkoholuPhysicalActivity – poziom aktywności fizycznejDietQuality – jakość dietySleepQuality – jakość snuFamilyHistoryAlzheimers – historia rodzinna AlzheimeraCardiovascularDisease – choroby sercowo-naczynioweDiabetes – cukrzycaDepression – depresjaHeadInjury – urazy głowyHypertension – nadciśnienieSystolicBP, DiastolicBP – ciśnienie tętniczeCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – wynik Mini-Mental State ExaminationFunctionalAssessment – ocena funkcjonalnaADL – czynności codzienneMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – tylko w train.csv
1 = diagnoza Alzheimera0 = bez AlzheimeraCel końcowy: przewidzieć Diagnosis dla wierszy z test.csv.
Pierwsze dwa podzadania sprawdzają eksploracyjną analizę danych.
Ostatnie podzadanie ocenia wydajność modelu klasyfikacji.
Oblicz dla każdego pacjenta z test.csv ilu pacjentów jest w zbiorze treningowym (train.csv), którzy mają taki sam wiek jak pacjent ze zbioru testowego.
Wyświetl w pliku submisji liczbę naturalną (zgodnie z formatem przedstawionym poniżej).
Dla każdego pacjenta z test.csv, określ procent pacjentów palących
(Smoking = 1) ze zbioru treningowego (train.csv) którzy mają taki sam wiek
jak dany pacjent.
Formuła obliczeniowa dla pacjenta w wieku v:
(liczba pacjentów palących z train z Age = v) /(całkowita liczba pacjentów z train z Age = v) * 100Wyświetl w pliku submisji liczbę rzeczywistą między 0 a 100,
z maksymalnie 2 miejscami po przecinku, dla każdego pacjenta.
Jeśli w zbiorze treningowym nie ma żadnego pacjenta w danym wieku,
wyświetlana wartość będzie 0.
Zbuduj model klasyfikacji, który przewiduje prawdopodobieństwo diagnozy Alzheimera
(p ∈ [0,1]) dla każdego pacjenta z test.csv.
Ocena odbywa się przy użyciu ROC Curve i AUC (Area Under the ROC Curve).
Podzadania 1–2 są oceniane dokładnie (przez porównanie).
Plik submission.csv musi zawierać 3 linie dla każdego pacjenta z testu,
odpowiadające 3 podzadaniom.
Struktura:
subtaskID, datapointID, answergdzie:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Dla Podzadania 3, ocena odbywa się przy użyciu ROC AUC (Area Under the ROC Curve),
standardowej metryki dla problemów klasyfikacji binarnej.