Zadatak #22
Autor:Mihai Nan
Težina
Vaš najbolji rezultat
N/D
Želi se izgraditi model klasifikacije koji će predvidjeti ima li pacijent dijabetes na osnovu analiza krvi i demografskih podataka.
Svaki pacijent je karakteriziran s 8 numeričkih atributa dobivenih iz analiza i kliničkih mjerenja, a oznaka (target) označava prisutnost dijabetesa (1 za pozitivan, 0 za negativan).
Ovaj tip problema pripada kategoriji binarne klasifikacije (binary classification).
pregnancies – broj trudnoćaglucose – razina glukoze u krviblood_pressure – krvni tlakskin_thickness – debljina kožnog naborainsulin – razina inzulinabmi – indeks tjelesne masediabetes_pedigree_function – genetski rezultat rizikaage – dob pacijentatrain.csvSadrži svih 8 stupaca features plus stupac:
target – označava prisutnost dijabetesa (0 ili 1)Primjer:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvSadrži iste stupce bez target, ali uključuje SampleID.
Primjer:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
Izlazna datoteka (submission.csv) mora sadržavati točno dva stupca:
SampleIDlabel – predviđena oznaka modela (0 ili 1)Primjer:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
Evaluacija modela će se provoditi koristeći sljedeću metriku:
Ova metrika je prikladna za binarnu klasifikaciju jer daje jednaku važnost točnosti predviđanja za obje klase.
Opća formula:
gdje je:
Konačni rezultat se izražava kao postotak (0–100), zaokružen na dvije decimale.
Dataset potječe iz originalne kolekcije:
Pima Indians Diabetes Database – Kaggle