难度
您的最佳成绩
不适用
在一个平行的社交网络世界中,Chirper 是最受欢迎的微消息平台。
最近,该平台被著名的(略显古怪的)Melon Husk 收购,他决定将其重新品牌化为 Y。
为了让 Y 更清洁、更友好,Melon Husk 要求你的数据科学团队构建一个分类模型,自动检测有问题的 chirp(垃圾信息、无关内容或噪音),以便从信息流中过滤掉这些内容。
你收到了一组历史 chirp 数据,需要构建一个能够对新 chirp 进行分类的模型。
你可以使用两个文件:
label 的历史 chirp(problematic = 1 / normal = 0)主要目标:预测 chirp 为有问题的概率
(值在 0 和 1 之间,其中 0 = 确定正常的 chirp,1 = 确定有问题的 chirp)。
每一行代表在 Chirper Y 上发布的一个 chirp,具有以下属性:
id – chirp 的唯一标识符chirp – chirp 的文本内容label – 仅在 train.csv 中,1(有问题)/ 0(正常)最终目标:为 test.csv 中的行预测 label。
前两个子任务验证对 chirp 的简单分析。
最后一个子任务评估分类模型的性能。
确定每个 chirp 的字符数长度。
为此子任务显示一个整数。
计算 chirp 中字符 # 的出现次数
(过度标签的重要指标,垃圾信息发送者的最爱 😄)。
构建一个分类模型,为测试集中的每一行预测 chirp
为有问题的概率(p ∈ [0,1])。
评估使用 ROC 曲线 和 AUC(ROC 曲线下面积)。
子任务 1-2 通过精确比较进行评估。
submission.csv 文件必须包含测试集中每一行对应的 3 行,
对应 3 个子任务。
结构:
subtaskID,datapointID,answer其中:
id 值# 的出现次数(整数)id = 25758 的示例:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083对于子任务 3,评估使用 ROC AUC(ROC 曲线下面积)。
这是一个综合衡量分类器在所有可能决策阈值下性能的单一指标。
绘制 ROC 曲线,表示:
曲线下面积(AUC) 使用梯形法则计算:
分数解释: