题目 #39
作者:Mihai Nan
难度
您的最佳成绩
不适用
在大王国图书馆中,档案管理员面临着一项越来越困难的任务:
成千上万的手稿、羊皮纸和古代编年史需要组织、比较和索引。
为了帮助他们,祖先们创造了一个传奇的机制:相似度神谕。这是
一个能够以卓越的精度确定两个文本片段相似程度的装置,返回一个0到5之间的分数。
但这个机制随着时间的推移而退化,档案管理员大议会决定需要
一个使用机器学习构建的现代版本。
为此,为你提供了两个文件:
train.csv - 由抄写员手动标注的羊皮纸test.csv - 需要由你的解决方案分析的新配对你的任务是通过一系列分析和最终的预测模型来重建神谕。
train.csv 和 test.csv 文件中的每一行代表一对句子:
最终目标是为test.csv中的每一行预测score。
对于前几个子任务,你需要分析train.csv和test.csv中提供的数据
并提取关于测试中句子的各种相关信息。
计算测试集中每一行的每个句子(sentence1 和 sentence2)的长度
并根据平均长度标记配对:
Short 如果平均值 < 50Medium 如果 50 ≤ 平均值 < 100Long 如果平均值 ≥ 100对于测试中的每一行,计算每个句子(sentence1 和 sentence2)的单词数,并根据以下公式确定总数:
总数 = 单词数(sentence1) + 单词数(sentence2)确定测试中每一行的sentence1长度和sentence2长度之间的绝对差值。
换句话说,对于每一行我们需要计算:
|字符数(sentence1) - 字符数(sentence2)|构建一个机器学习模型,能够为test.csv中的每一行预测数值score。
最终评估将使用MAE (平均绝对误差),计算如下:
子任务4的指标是:
对于子任务1-3,答案进行精确评估。
submission.csv文件必须包含测试中每一行对应的4行,
对应4个子任务。
结构:
subtaskID datapointID answer列的含义:
subtaskID – 1到4之间的数字
datapointID – 测试中的sampleID
answer – 结果:
Short / Medium / LongsampleID = 1714的示例:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74祝你成功!档案管理员大议会将希望寄托在你们身上,以重新唤醒相似度神谕!🧙♂️