בעיה #33
מחבר:Mihai Nan
רמת קושי
הציון הטוב ביותר שלך
לא זמין
עבור בעיה זו עליכם לממש מודל למידת מכונה כדי לחזות את הערך של השדה Status באמצעות מערך נתונים זמין, המכיל מידע על מטופלים. מערך הנתונים מאורגן בקובץ CSV הכולל תכונות (features) שונות, והערכת המודל תתבצע על בסיס הדיוק עבור הקטגוריה Dead.
מערך הנתונים מכיל את השדות הבאים:
עבור המשימות הראשונות, תצטרכו לטעון את מערך הנתונים ולבצע ניתוחים סטטיסטיים על test.csv.
סווגו את התפקוד הכלייתי עבור כל מטופל ממערך הבדיקה על בסיס הערך GFR:
Normal אם GFR >= 90Mildly Decreased אם 60 <= GFR < 90חשבו את הרבעונים של הערכים בעמודה Serum Creatinine (Q1, Q2, Q3) עבור מערך נתוני האימון וסווגו את המטופלים ממערך נתוני הבדיקה לפי הקטגוריות הבאות:
Very Low אם Serum Creatinine <= Q1Low אם Q1 < Serum Creatinine <= Q2High אם Q2 < Serum Creatinine <= Q3Very High אם Serum Creatinine > Q3קביעת ערך BMI כך:
מספר המטופלים מ-train הנמצאים באותו T Stage כמו המטופל מ-test.
בנו מודל ML לחיזוי Status (Dead או Alive) בהתאם לתכונות. ההערכה מתבצעת על בסיס הדיוק עבור הקטגוריה Dead.
מדד ההערכה הוא הדיוק עבור הקטגוריה Dead:
הציון ניתן בהתאם לערך precision (weighted) שהושג על ידי המודל:
| טווח precision | ציון |
|---|---|
| < 0.60 | 0 |
| 0.60 – 0.69 | 10 |
| 0.70 – 0.74 | 20 |
| 0.75 – 0.79 | 30 |
| 0.80 – 0.84 | 40 |
| ≥ 0.85 | 60 |
כאשר:
DeadDead בטעותStatus.sample_output לבדיקה מקומית מעניקה 5 נקודות.הקובץ submission.csv צריך להכיל את התוצאות של כל 5 המשימות עבור כל שורה ממערך הבדיקה.
כל שורה מ-test מייצרת 5 שורות בקובץ, אחת עבור כל משימה.
מבנה הקובץ:
subtaskID, datapointID, answerמשמעות העמודות:
Normal / Mildly Decreased / DecreasedVery Low / Low / High / Very High0 או 11 אם המודל חוזה Dead, 0 אם חוזה Aliveדוגמה עבור מטופל אחד עם מזהה 3220:
subtaskID datapointID answer1 3220 Normal2 3220 Low3 3220 04 3220 55 3220 1