בעיה #22
מחבר:Mihai Nan
רמת קושי
הציון הטוב ביותר שלך
לא זמין
מטרת הבעיה היא בניית מודל סיווג שיחזה האם למטופל יש סוכרת על בסיס בדיקות דם ונתונים דמוגרפיים.
כל מטופל מאופיין על ידי 8 תכונות מספריות המתקבלות מבדיקות ומדידות קליניות, והתווית (target) מציינת נוכחות סוכרת (1 עבור חיובי, 0 עבור שלילי).
סוג זה של בעיה שייך לקטגוריה של סיווג בינארי (binary classification).
pregnancies – מספר הריונותglucose – רמת הגלוקוז בדםblood_pressure – לחץ דםskin_thickness – עובי קפל העורinsulin – רמת האינסוליןbmi – מדד מסת הגוףdiabetes_pedigree_function – ציון הסיכון הגנטיage – גיל המטופלtrain.csvמכיל את כל 8 עמודות הfeatures בתוספת העמודה:
target – מציינת נוכחות סוכרת (0 או 1)דוגמה:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvמכיל את אותן עמודות ללא target, אך כולל SampleID.
דוגמה:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
קובץ הפלט (submission.csv) חייב להכיל בדיוק שתי עמודות:
SampleIDlabel – התווית שחזה המודל (0 או 1)דוגמה:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
הערכת המודלים תתבצע באמצעות המטריקה הבאה:
מטריקה זו מתאימה לסיווג בינארי, מכיוון שהיא נותנת חשיבות שווה לנכונות החיזויים עבור שתי הקטגוריות.
הנוסחה הכללית:
כאשר:
הציון הסופי מובע כאחוז (0–100), מעוגל לשני מקומות עשרוניים.
מערך הנתונים מגיע מהאוסף המקורי:
Pima Indians Diabetes Database – Kaggle