Oppgave #22
Forfatter:Mihai Nan
Vanskelighetsgrad
Din beste poengsum
N/A
Det ønskes å bygge en klassifikasjonsmodell som kan forutsi om en pasient har diabetes basert på blodprøver og demografiske data.
Hver pasient karakteriseres av 8 numeriske attributter hentet fra analyser og kliniske målinger, og etiketten (target) indikerer tilstedeværelse av diabetes (1 for positiv, 0 for negativ).
Denne typen problem tilhører kategorien binær klassifikasjon (binary classification).
pregnancies – antall graviditeterglucose – glukosenivå i blodetblood_pressure – blodtrykkskin_thickness – tykkelse på hudfoldeninsulin – insulinnivåbmi – kroppsmasseindeksdiabetes_pedigree_function – genetisk risikoscoreage – pasientens aldertrain.csvInneholder alle de 8 features-kolonnene pluss kolonnen:
target – indikerer tilstedeværelse av diabetes (0 eller 1)Eksempel:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvInneholder de samme kolonnene uten target, men inkluderer SampleID.
Eksempel:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
Utdatafilen (submission.csv) må inneholde nøyaktig to kolonner:
SampleIDlabel – etiketten forutsagt av modellen (0 eller 1)Eksempel:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
Evaluering av modellene vil bli gjort ved bruk av følgende metrikk:
Denne metrikken er egnet for binær klassifikasjon, fordi den gir lik vekt til nøyaktigheten av prediksjoner for begge klassene.
Den generelle formelen:
hvor:
Den endelige scoren uttrykkes som prosent (0–100), avrundet til to desimaler.
Datasettet kommer fra den opprinnelige samlingen:
Pima Indians Diabetes Database – Kaggle