难度
您的最佳成绩
不适用
为了保持健康,Petronel决定变得更加运动。为此,他开始定期骑自行车,既用于上班通勤也用于娱乐。他使用专门的应用程序来监控自己的骑行路线,并希望获得关于自己骑行的统计数据,观察自己如何将实用与娱乐相结合,根据目的对骑行进行分类。
在获得了描述自己开始骑自行车以来所有骑行路线的数据集后,Petronel希望了解自己按日历月份计算的平均骑行速度。此外,Petronel开始为骑行路线打标签,将其分为:在家和工作地点之间的通勤路线,没有绕路;在家和工作地点之间的通勤路线,但为了娱乐目的进行了绕路;以及纯娱乐性骑行。由于打标签很繁琐,他需要一个程序来自动为剩余的(和未来的)骑行路线打标签,并具有合理的精度。
文件dataset_train.csv在标题中包含以下列:
Activity ID:骑行的唯一IDActivity Date:GMT时区下骑行开始的日期和时间,格式为Aug 23, 2025, 4:55:36 PMDistance:骑行距离,以公里为单位Elapsed Time:骑行总持续时间,包括休息时间Moving Time:实际骑自行车的有效时间Starting Latitude, Starting Longitude:起点的地理坐标Finish Latitude, Finish Longitude:终点的地理坐标Label:应用于骑行的标签,含义如下:
COMMUTE:无绕路的通勤骑行;LEISURELY_COMMUTE:有绕路的通勤骑行;PURE_LEISURE:纯娱乐性骑行。文件dataset_eval.csv包含与训练数据文件相同的字段,除了需要确定的Label字段。
根据训练数据集中的可用数据,确定一年中每个月的平均移动速度,以km/h表示。
基于dataset_train.csv文件中记录的标签,对dataset_eval.csv文件中的骑行路线进行标记。
对于要求1:日历年12个月中每个月正确计算的平均速度各得2.5分 - 总计30分。
对于要求2:数据集中每正确标记1%得0.82分,最高70分。换句话说,容忍约15%的错误标记。
输出文件为CSV格式,标题如下:
subtaskID,Answer1,Answer2对于要求1,恰好12行,每个月一行,如下所示:
1,<月份>,<平均速度>月份用三字母缩写表示(Jan、Feb等),平均速度表示为小数点后恰好5位小数的实数,通过截断进行舍入。
对于要求2,评估文件中每条记录一行,如下所示:
2,<骑行ID>,<标签>骑行ID直接从评估文件中获取,标签为上述描述的值之一。
在此链接找到一个zip压缩包,其中包含训练和评估文件,以及一个有效提交文件的示例,可获得1分。