الصعوبة
أفضل نتيجة لك
غير متوفر
يرغب معهد طبي في تطوير نظام آلي يساعد في
تحديد المرضى المعرضين لخطر الإصابة بالزهايمر، باستخدام البيانات السريرية
والديموغرافية والسلوكية.
لقد تلقيت مجموعة بيانات تحتوي على مرضى تم تقييمهم سريرياً، والهدف هو بناء
نموذج تصنيف ثنائي يمكنه التنبؤ بالتشخيص للمرضى الجدد.
تم توفير الملفات التالية لك:
الهدف الرئيسي: التنبؤ باحتمالية تشخيص المريض بالزهايمر
(قيمة بين 0 و 1، حيث 0 = مريض سليم، 1 = مريض مصاب بالزهايمر).
كل صف يمثل مريضاً ويحتوي على الخصائص التالية:
PatientID – معرف فريد للمريضAge – عمر المريضGender – الجنس (0 = أنثى، 1 = ذكر)Ethnicity – العرق (قيم مرمزة رقمياً)EducationLevel – المستوى التعليمي (مرمز رقمياً)BMI – مؤشر كتلة الجسمSmoking – مدخن (1) / غير مدخن (0)AlcoholConsumption – استهلاك الكحولPhysicalActivity – مستوى النشاط البدنيDietQuality – جودة النظام الغذائيSleepQuality – جودة النومFamilyHistoryAlzheimers – تاريخ عائلي للزهايمرCardiovascularDisease – أمراض القلب والأوعية الدمويةDiabetes – السكريDepression – الاكتئابHeadInjury – إصابات الرأسHypertension – ارتفاع ضغط الدمSystolicBP, DiastolicBP – ضغط الدمCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – نتيجة فحص الحالة العقلية المصغرFunctionalAssessment – التقييم الوظيفيADL – الأنشطة اليوميةMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – فقط في train.csv
1 = تشخيص الزهايمر0 = بدون زهايمرالهدف النهائي: التنبؤ بـ Diagnosis للصفوف في test.csv.
أول مهمتين فرعيتين تتحققان من التحليل الاستكشافي للبيانات.
المهمة الفرعية الأخيرة تقيم أداء نموذج التصنيف.
احسب لكل مريض في test.csv كم عدد المرضى في مجموعة التدريب (train.csv) الذين لديهم نفس عمر المريض في مجموعة الاختبار.
اعرض في ملف التسليم رقماً طبيعياً (وفقاً للتنسيق المعروض أدناه).
لكل مريض في test.csv، حدد نسبة المرضى المدخنين
(Smoking = 1) من مجموعة التدريب (train.csv) الذين لديهم نفس العمر
مع المريض المعني.
صيغة الحساب لمريض بعمر v:
(عدد المرضى المدخنين في train مع Age = v) /(العدد الإجمالي للمرضى في train مع Age = v) * 100اعرض في ملف التسليم رقماً حقيقياً بين 0 و 100،
بحد أقصى منزلتان عشريتان، لكل مريض.
إذا لم يوجد في مجموعة التدريب أي مريض بالعمر المعني،
ستكون القيمة المعروضة 0.
ابنِ نموذج تصنيف يتنبأ باحتمالية تشخيص الزهايمر
(p ∈ [0,1]) لكل مريض في test.csv.
يتم التقييم باستخدام منحنى ROC و AUC (المساحة تحت منحنى ROC).
يتم تقييم المهام الفرعية 1-2 بدقة (من خلال المقارنة).
يجب أن يحتوي ملف submission.csv على 3 أسطر لكل مريض في الاختبار،
تتوافق مع المهام الفرعية الثلاث.
الهيكل:
subtaskID, datapointID, answerحيث:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873بالنسبة لـ المهمة الفرعية 3، يتم التقييم باستخدام ROC AUC (المساحة تحت منحنى ROC)،
وهو مقياس معياري لمشاكل التصنيف الثنائي.