Težina
Vaš najbolji rezultat
N/D
Medicinski institut želi razviti automatizirani sustav koji će pomoći u
identificiranju pacijenata s rizikom od Alzheimerove bolesti, koristeći kliničke,
demografske i bihevioralne podatke.
Dobio si skup podataka s klinički evaluiranim pacijentima, a cilj je da izgradiš
model binarne klasifikacije koji može predvidjeti dijagnozu za nove pacijente.
Stavljene su ti na raspolaganje sljedeće datoteke:
Glavni cilj: predviđanje vjerojatnosti da će pacijent biti dijagnosticiran s Alzheimerovom bolešću
(vrijednost između 0 i 1, gdje 0 = zdrav pacijent, 1 = pacijent s Alzheimerovom bolešću).
Svaki red predstavlja pacijenta i sadrži sljedeće atribute:
PatientID – jedinstveni identifikator pacijentaAge – dob pacijentaGender – spol (0 = ženski, 1 = muški)Ethnicity – etnicitet pacijenta (numerički kodirane vrijednosti)EducationLevel – razina obrazovanja (numerički kodirana)BMI – indeks tjelesne maseSmoking – pušač (1) / nepušač (0)AlcoholConsumption – konzumacija alkoholaPhysicalActivity – razina fizičke aktivnostiDietQuality – kvaliteta prehraneSleepQuality – kvaliteta snaFamilyHistoryAlzheimers – obiteljska povijest Alzheimerove bolestiCardiovascularDisease – kardiovaskularne bolestiDiabetes – dijabetesDepression – depresijaHeadInjury – ozljede glaveHypertension – hipertenzijaSystolicBP, DiastolicBP – krvni tlakCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – rezultat Mini-Mental State ExaminationFunctionalAssessment – funkcionalna procjenaADL – svakodnevne aktivnostiMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – samo u train.csv
1 = dijagnoza Alzheimerove bolesti0 = bez Alzheimerove bolestiKonačni cilj: predvidjeti Diagnosis za redove u test.csv.
Prva dva podzadatka provjeravaju eksplorativnu analizu podataka.
Zadnji podzadatak evaluira performanse modela klasifikacije.
Izračunaj za svakog pacijenta iz test.csv koliko pacijenata je u skupu za treniranje (train.csv) koji imaju istu dob kao pacijent iz skupa za testiranje.
Prikaži u datoteci za predaju prirodan broj (prema formatu prikazanom niže).
Za svakog pacijenta iz test.csv, odredi postotak pacijenata pušača
(Smoking = 1) iz skupa za treniranje (train.csv) koji imaju istu dob
kao taj pacijent.
Formula za izračun za pacijenta s dobi v:
(broj pacijenata pušača iz train s Age = v) /(ukupan broj pacijenata iz train s Age = v) * 100Prikaži u datoteci za predaju realan broj između 0 i 100,
s maksimalno 2 decimale, za svakog pacijenta.
Ako u skupu za treniranje ne postoji niti jedan pacijent s tom dobi,
prikazana vrijednost će biti 0.
Izgradi model klasifikacije koji predviđa vjerojatnost dijagnoze Alzheimerove bolesti
(p ∈ [0,1]) za svakog pacijenta iz test.csv.
Evaluacija se vrši koristeći ROC krivulju i AUC (Area Under the ROC Curve).
Podzadaci 1–2 se evaluiraju točno (usporedbom).
Datoteka submission.csv mora sadržavati 3 linije za svakog pacijenta iz test skupa,
koje odgovaraju 3 podzadatka.
Struktura:
subtaskID, datapointID, answergdje:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Za Podzadatak 3, evaluacija se vrši koristeći ROC AUC (Area Under the ROC Curve),
standardnu metriku za probleme binarne klasifikacije.