难度
您的最佳成绩
不适用
多年来,高中毕业考试(Bacalaureat)的成绩为罗马尼亚高中的表现提供了详细的图像。通过分析多年的历史数据,我们可以发现趋势、学校表现的演变,有时还能发现异常的结果。
在这种背景下,本题的目标是统计分析高中在毕业考试中的表现,构建预测模型,并使用机器学习方法识别异常结果。
为了解决本题的要求,您可以访问一个结构化的数据集,包含两个csv文件:train.csv 和 test.csv。该数据集包含高中在不同毕业考试科目上的聚合结果,时间跨度为 2014–2023年。
数据集中的每一行(无论是训练集还是测试集)代表一个 高中 在某个 科目 在某一 年份 的结果。
id – 行的唯一标识符an – 考试年份liceu – 高中名称judet – 高中所在县materie – 毕业考试学科medie – 该高中学生在该学科获得的平均分procent_reusita – 通过考试的学生百分比numar_candidati – 考生人数preferinta_materie – 选择该学科的学生百分比anomalie - 可以是 0(如果不被认为是异常情况)或 1(如果情况不寻常)注意:对于每个高中,我们还有一些总体统计数据。对于这些数据,在 materie 列中我们找到值 GENERAL。
文件 train.csv 包含 2014-2022年 期间的统计数据,而文件 test.csv 包含 2023年 的数据,但 medie 和 anomalie 列不可用。
识别2023年在 COLEGIUL NATIONAL "UNIREA" FOCSANI 偏好度最高的科目,如果我们排除对所有考生都是必修的 LIMBA ROMANA。
识别在 2014-2022年 期间,INFORMATICA MI C-C++ 科目在 COLEGIUL NATIONAL "UNIREA" FOCSANI 最受欢迎的年份。我们认为受欢迎程度由 preferinta_materie 列中的百分比决定(这个百分比越高,我们就认为该科目越受欢迎)。
使用 train.csv 文件中的可用信息,估计 test.csv 文件中每一行(2023年)的 平均分。
对于这个要求,您可以使用任何基于历史数据的统计分析或建模方法,考虑:
目标是获得尽可能接近真实值的估计。
分析 2014–2022年 期间的历史数据,并对 test.csv 文件中的每一行决定,2023年对应的结果是:
在做决定时,您可以考虑:
每一行的最终结果必须是二进制标签:
0 - 正常结果1 - 异常结果为了自动评估,您需要上传一个 csv 格式的文件,结构如下:
id – 行标识符(对应 test.csv 中的标识符)
ididsubtaskID – 要求标识符:
1 用于识别偏好科目(要求1)2 用于识别信息学的繁荣年份(要求2)3 用于平均分估计(要求3)4 用于识别异常结果(要求4)answer – 对应要求的答案:
subtaskID = 1:科目名称,完全按照数据集中出现的方式subtaskID = 2:年份subtaskID = 3:数值(平均分估计)subtaskID = 4:0 或 1要求1–2采用精确评估(通过比较)。
要求3使用 平均绝对误差(MAE) 进行评估。
规则:
对于要求4,根据以下规则给分: