Uzdevums #22
Autors:Mihai Nan
Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Nepieciešams izveidot klasifikācijas modeli, kas prognozē, vai pacientam ir diabēts, pamatojoties uz asins analīzēm un demogrāfiskiem datiem.
Katru pacientu raksturo 8 skaitliski atribūti, kas iegūti no analīzēm un klīniskiem mērījumiem, bet etiķete (target) norāda diabēta esamību (1 pozitīvam, 0 negatīvam).
Šāda veida problēma pieder binārās klasifikācijas (binary classification) kategorijai.
pregnancies – grūtniecību skaitsglucose – glikozes līmenis asinīsblood_pressure – asinsspiediensskin_thickness – ādas krokas biezumsinsulin – insulīna līmenisbmi – ķermeņa masas indekssdiabetes_pedigree_function – ģenētiskā riska rādītājsage – pacienta vecumstrain.csvSatur visas 8 features kolonnas plus kolonna:
target – norāda diabēta esamību (0 vai 1)Piemērs:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvSatur tās pašas kolonnas bez target, bet iekļauj SampleID.
Piemērs:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
Izvades failam (submission.csv) jāsatur tieši divas kolonnas:
SampleIDlabel – modeļa prognozētā etiķete (0 vai 1)Piemērs:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
Modeļu novērtēšana tiks veikta, izmantojot šādu metriku:
Šī metrika ir piemērota binārajai klasifikācijai, jo piešķir vienādu nozīmi prognožu precizitātei abām klasēm.
Vispārējā formula:
kur:
Galīgais rezultāts tiek izteikts kā procenti (0–100), noapaļots līdz divām decimāldaļām.
Datu kopa nāk no oriģinālās kolekcijas:
Pima Indians Diabetes Database – Kaggle