加载中...
难度
您的最佳成绩
不适用
一家医疗机构希望开发一个自动化系统,帮助
识别阿尔茨海默病高风险患者,使用临床、
人口统计学和行为数据。
你收到了一个经过临床评估的患者数据集,目标是构建一个
二元分类模型,能够预测新患者的诊断。
为你提供了以下文件:
主要目标:预测患者被诊断为阿尔茨海默病的概率
(值在 0 和 1 之间,其中 0 = 健康患者,1 = 阿尔茨海默病患者)。
每行代表一个患者,包含以下属性:
PatientID – 患者唯一标识符Age – 患者年龄Gender – 性别(0 = 女性,1 = 男性)Ethnicity – 种族(数字编码值)EducationLevel – 教育水平(数字编码)BMI – 体重指数Smoking – 吸烟者(1)/ 非吸烟者(0)AlcoholConsumption – 酒精消费PhysicalActivity – 体力活动水平DietQuality – 饮食质量SleepQuality – 睡眠质量FamilyHistoryAlzheimers – 阿尔茨海默病家族史CardiovascularDisease – 心血管疾病Diabetes – 糖尿病Depression – 抑郁症HeadInjury – 头部外伤Hypertension – 高血压SystolicBP, DiastolicBP – 血压CholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – 简易精神状态检查评分FunctionalAssessment – 功能评估ADL – 日常生活活动MemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – 仅在train.csv中
1 = 阿尔茨海默病诊断0 = 无阿尔茨海默病最终目标:预测 test.csv 中行的 Diagnosis。
前两个子任务验证数据探索性分析。
最后一个子任务评估分类模型的性能。
对于 test.csv 中的每个患者,计算训练集(train.csv)中有多少患者与测试集中该患者的年龄相同。
在提交文件中显示一个自然数(按照下面展示的格式)。
对于 test.csv 中的每个患者,确定训练集(train.csv)中年龄相同
的患者中吸烟者的百分比(Smoking = 1)。
年龄为 v 的患者的计算公式:
(train中Age = v的吸烟患者数量) /(train中Age = v的患者总数) * 100在提交文件中显示一个0到100之间的实数,
最多保留2位小数,对应每个患者。
如果训练集中不存在该年龄的患者,
显示的值将为 0。
构建一个分类模型,预测 test.csv 中每个患者的阿尔茨海默病诊断概率
(p ∈ [0,1])。
评估使用 ROC曲线 和 AUC(ROC曲线下面积)。
子任务1-2进行精确评估(通过比较)。
submission.csv 文件必须包含测试集中每个患者的3行,
对应3个子任务。
结构:
subtaskID, datapointID, answer其中:
PatientID 值PatientID = 4751 的示例:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873对于子任务3,评估使用 ROC AUC(ROC曲线下面积),
这是二元分类问题的标准指标。