רמת קושי
הציון הטוב ביותר שלך
לא זמין
מכון רפואי מעוניין לפתח מערכת אוטומטית שתסייע בזיהוי חולים בסיכון לאלצהיימר, תוך שימוש בנתונים קליניים, דמוגרפיים והתנהגותיים.
קיבלת מערך נתונים עם חולים שהוערכו קלינית, והמטרה היא לבנות מודל סיווג בינארי שיוכל לחזות את האבחנה עבור חולים חדשים.
הועמדו לרשותך הקבצים הבאים:
המטרה העיקרית: חיזוי ההסתברות שחולה יאובחן עם אלצהיימר
(ערך בין 0 ל-1, כאשר 0 = חולה בריא, 1 = חולה עם אלצהיימר).
כל שורה מייצגת חולה ומכילה את התכונות הבאות:
PatientID – מזהה ייחודי של החולהAge – גיל החולהGender – מין (0 = נקבה, 1 = זכר)Ethnicity – מוצא החולה (ערכים מקודדים מספרית)EducationLevel – רמת השכלה (מקודד מספרית)BMI – מדד מסת הגוףSmoking – מעשן (1) / לא מעשן (0)AlcoholConsumption – צריכת אלכוהולPhysicalActivity – רמת פעילות גופניתDietQuality – איכות התזונהSleepQuality – איכות השינהFamilyHistoryAlzheimers – היסטוריה משפחתית של אלצהיימרCardiovascularDisease – מחלות לב וכלי דםDiabetes – סוכרתDepression – דיכאוןHeadInjury – פגיעות ראשHypertension – יתר לחץ דםSystolicBP, DiastolicBP – לחץ דםCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – ציון Mini-Mental State ExaminationFunctionalAssessment – הערכה תפקודיתADL – פעילויות יומיומיותMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – רק ב-train.csv
1 = אבחנת אלצהיימר0 = ללא אלצהיימרהמטרה הסופית: חזה את Diagnosis עבור השורות ב-test.csv.
שתי המשימות הראשונות בודקות ניתוח חקרני של הנתונים.
המשימה האחרונה מעריכה את ביצועי מודל הסיווג.
חשב עבור כל חולה ב-test.csv כמה חולים יש במערך האימון (train.csv) שיש להם אותו גיל כמו החולה במערך הבדיקה.
הצג בקובץ ההגשה מספר טבעי (בהתאם לפורמט המוצג להלן).
עבור כל חולה ב-test.csv, קבע את אחוז החולים המעשנים
(Smoking = 1) ממערך האימון (train.csv) שיש להם אותו גיל
כמו החולה הרלוונטי.
נוסחת החישוב עבור חולה עם גיל v:
(מספר חולים מעשנים ב-train עם Age = v) /(מספר כולל החולים ב-train עם Age = v) * 100הצג בקובץ ההגשה מספר ממשי בין 0 ל-100,
עם מקסימום 2 ספרות אחרי הנקודה, עבור כל חולה.
אם במערך האימון לא קיים אף חולה עם הגיל הרלוונטי,
הערך המוצג יהיה 0.
בנה מודל סיווג שחוזה את ההסתברות לאבחנת אלצהיימר
(p ∈ [0,1]) עבור כל חולה ב-test.csv.
ההערכה נעשית באמצעות ROC Curve ו-AUC (Area Under the ROC Curve).
משימות 1-2 מוערכות בדיוק (באמצעות השוואה).
הקובץ submission.csv חייב להכיל 3 שורות עבור כל חולה ב-test,
המתאימות ל-3 המשימות.
מבנה:
subtaskID, datapointID, answerכאשר:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873עבור משימה 3, ההערכה נעשית באמצעות ROC AUC (Area Under the ROC Curve),
מטריקה סטנדרטית לבעיות סיווג בינארי.