加载中...
题目 #33
作者:Mihai Nan
难度
您的最佳成绩
不适用
对于这个问题,您需要实现一个机器学习模型来预测Status字段的值,使用可用的数据集,该数据集包含患者信息。数据集以CSV文件的形式组织,包含各种特征(features),模型评估将基于Dead类别的精确度。
数据集包含以下字段:
对于前几个子任务,您需要加载数据集并对test.csv进行统计分析。
根据GFR值对测试集中的每个患者进行肾功能分类:
Normal 如果 GFR >= 90Mildly Decreased 如果 60 <= GFR < 90计算训练数据集中Serum Creatinine列值的四分位数(Q1, Q2, Q3),并根据以下标准对测试数据集中的患者进行分类:
Very Low 如果 Serum Creatinine <= Q1Low 如果 Q1 < Serum Creatinine <= Q2High 如果 Q2 < Serum Creatinine <= Q3Very High 如果 Serum Creatinine > Q3确定BMI值如下:
训练集中与测试患者处于相同T Stage的患者数量。
构建一个ML模型来根据特征预测Status(Dead或Alive)。评估基于Dead类别的精确度。
评估指标是Dead类别的精确度:
分数根据模型获得的precision(加权)值分配:
| 精确度区间 | 分数 |
|---|---|
| < 0.60 | 0 |
| 0.60 – 0.69 | 10 |
| 0.70 – 0.74 | 20 |
| 0.75 – 0.79 | 30 |
| 0.80 – 0.84 | 40 |
| ≥ 0.85 | 60 |
其中:
Dead的患者数量Dead的患者数量Status。sample_output进行本地测试可获得5分。submission.csv文件必须包含测试集中每一行的所有5个子任务的结果。
测试集中的每一行生成文件中的5行,每个子任务一行。
文件结构:
subtaskID, datapointID, answer列的含义:
Normal / Mildly Decreased / DecreasedVery Low / Low / High / Very High0 或 11 如果模型预测Dead,0 如果预测AliveID为3220的单个患者示例:
subtaskID datapointID answer1 3220 Normal2 3220 Low3 3220 04 3220 55 3220 1