加载中...
难度
您的最佳成绩
不适用
你的公司希望保护用户免受不需要的邮件(垃圾邮件)的侵害。
为此,决定构建一个自动系统来识别
垃圾邮件并将其与合法邮件(非垃圾邮件)分离。
你收到了一组带标签的邮件,需要构建一个模型
来对新邮件进行分类。
为你提供了两个文件:
label 的历史邮件(spam = 1 / nonspam = 0)主要目标:预测邮件为垃圾邮件的概率(值在 0 和 1 之间,其中 0 = 确定非垃圾邮件,1 = 确定垃圾邮件)。
每一行代表一封邮件,具有以下属性:
sample_id - 唯一标识符text - 邮件内容label - 仅在 train.csv 中,1(垃圾邮件)/ 0(非垃圾邮件)最终目标:预测 test.csv 中行的 label。
前两个子任务验证邮件的简单分析。
最后一个子任务评估分类模型。
确定每封邮件的长度(字符数)。
为此子任务显示一个整数。
计算邮件中单词 free 的出现次数。
构建一个分类模型,预测测试集中每一行邮件为垃圾邮件的概率(p ∈ [0,1])。
评估使用 ROC 曲线 和 AUC(ROC 曲线下面积)。
子任务 1-2 进行精确评估(通过比较)。
文件 submission.csv 必须包含测试集中每一行对应的 3 行,
对应 3 个子任务。
结构:
subtaskID, datapointID, answer其中:
sample_id 的值free 的出现次数(整数)sample_id = 00042 的示例:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742对于 子任务 3,评估使用 ROC AUC(ROC 曲线下面积)。
这是一个综合衡量分类器在所有可能决策阈值下性能的单一指标。

