加载中...
题目 #30
作者:Mihai Nan
难度
您的最佳成绩
不适用
需要构建一个分类模型来预测与文本相关的主要情感。
每个样本都有一个短文本特征,标签(label)表示对应的情感(例如:joy、anger、sadness等)。
这个问题属于多类分类范畴。
text – 消息或文章的文本内容目标标签是:
label – 与文本相关的情感(字符串)train.csv包含以下列:
SampleIDtextlabel示例:
| SampleID | text | label |
|---|---|---|
| 1 | "I am so happy today!" | joy |
| 2 | "I feel really angry about this situation." | anger |
| 3 | "Feeling a bit sad after watching that movie." | sadness |
test.csv包含相同的列但没有label,但包括SampleID。
示例:
| SampleID | text |
|---|---|
| 101 | "What a wonderful surprise!" |
| 102 | "I can't believe this happened." |
输出文件(submission.csv)必须包含恰好两列:
SampleIDlabel – 模型预测的标签示例:
| SampleID | label |
|---|---|
| 101 | joy |
| 102 | surprise |
模型评估将使用宏平均F1分数:
其中:
最终分数将转换为0–100区间,使得高F1分数对应高分数。要获得最高分,F1分数需要大于或等于0.9。
数据集来自Kaggle:Kaggle Emotion Dataset。