加载中...
难度
您的最佳成绩
不适用
一家国际新闻机构的编辑部每天管理着来自各个领域的数千篇文章:经济、政治、科学、技术和环境。为了能够快速归档和分发信息,每篇文章都需要归入一个主题类别。
由于技术故障,一些最近文章的标签丢失了。编辑部求助于你来构建一个智能系统,能够基于内容自动分类新闻文章。
给定两个输入文件:
train.csv – 包含已知类别的新闻文章test.csv – 包含无类别的新闻文章每篇文章通过唯一的id标识,并有关联的文本。
使用train.csv中的数据,你需要构建一个分类模型来预测test.csv中每篇文章的标签(label)。
结果将保存在**submission.csv**文件中。
train.csv包含以下列:
id – 文章的唯一标识符(字符串,例如000001)text – 文章内容label – 文章类别(整数)示例:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csv包含以下列:
id – 唯一标识符text – 文章内容示例:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csv提交的生成文件必须是csv格式,包含以下内容:
id – 文章标识符label – 预测的类别示例:
id,label120001,2120002,3120003,3train.csv中推断。预测结果将与真实标签进行比较,计算准确率:
accuracy = (正确预测数量 / 总预测数量)最终分数基于获得的准确率使用以下规则计算: