难度
您的最佳成绩
不适用
在一个平行宇宙中,FairPlay 是负责在比赛期间监控球队和球员的部门。
多年来,FairPlay 观察到某些比赛在出现以下情况时更容易变得混乱:
为了尽可能避免丑闻,FairPlay 要求你构建一个模型,根据混乱潜力对比赛进行分类。
你有过去比赛的数据,需要构建一个分类模型来预测比赛是否会变得混乱。
为你提供了两个文件:
train.csv - 过去的比赛,带有 chaos_label 标签test.csv - 新比赛,无标签每一行代表一场比赛,包含以下列:
MatchID - 比赛的唯一标识符Season - 竞技赛季MatchWeek - 轮次HomeTeam - 主队AwayTeam - 客队Goals - 总进球数Shots - 总射门数Corners - 总角球数YellowCards - 黄牌数量RedCards - 红牌数量TeamStyles - 与比赛相关的比赛风格列表(例如:["AggressiveTackler", "HighPressure"])chaos_label - 仅在 train.csv 中,
预测 test.csv 中的比赛是否混乱(二进制值 - 0 或 1)。
前两个子任务验证对数据的理解和预处理。
最后一个子任务评估分类模型的性能。
计算"Chelsea"队踢过的比赛数量,包括客场和主场。
显示一个整数。
从 TeamStyles 列开始,计算一个名为 StyleAggressionScore 的数值分数,定义为:
StyleAggressionScore = (攻击性风格数量) / (总风格数量)被认为是攻击性的风格有:
AggressiveTacklerRiskTakerHighPressureChaosInducer结果必须是 0 和 1 之间的实数。
构建一个分类模型来预测比赛是混乱的(chaos_label = 1)还是受控的(chaos_label = 0)。
对于 test.csv 中的每一行,模型必须返回一个二进制预测:
模型可以使用数据集中任何可用的特征,包括在前面子任务中构建的人工特征。
对于子任务 3,使用宏平均 F1 分数进行评估。
宏平均 F1 分数计算如下:
这个指标平等对待两个类别,并惩罚只能正确预测多数类的模型。
评估阈值:
中间值按比例给分。
submission.csv 文件必须包含第一个子任务的一行,以及测试中每一行对应其他 2 个子任务的 2 行。
结构:
subtaskID,datapointID,answer其中:
subtaskID - 1、2 或 3datapointID - id 值(或第一个子任务为 1)answer - 取决于任务:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
数据集来源:https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv