加载中...
难度
您的最佳成绩
不适用
本问题的目的是根据罗马尼亚语的地区特征或标准形式对文本进行识别和分类。数据集包含从不同地区收集的文本片段。
| 列名 | 描述 |
|---|---|
| ID | 每个文本片段的唯一标识符 |
| text | 罗马尼亚语短语的实际内容 |
| label | 文本方言的分类(目标列) |
注意:label 列(方言)仅在训练数据 (train.csv) 中提供。三个可能的类别是:româna standard(标准罗马尼亚语)、graiul moldovenesc(摩尔多瓦方言)和 graiul bănățean(巴纳特方言)。
部分文本提取自 Ion Creangă 的作品 "Cinci pâini"。计算 train.csv 和 test.csv 中单词 "pâni"(单词 "pâini" 的古体形式)出现的总次数。
在 train.csv 中,计算 graiul moldovenesc 和 graiul bănățean 文本的平均标点符号数量。返回这两个值之间差的绝对值,保留两位小数。
对于 test.csv 中的每一行,计算文本中变音符号的数量。被视为变音符号的字符有:ă、â、î、ș、ț(及其大写变体 Ă、Â、Î、Ș、Ț)。
构建一个能够将测试文件中的文本正确分类为 3 个类别之一的模型。
通过精确核对答案进行评估。答案正确 = 满分,答案错误 = 0 分。
通过 accuracy(准确率)进行评估 —— 即正确答案占总数的比例。分数是成比例的:accuracy 1.0 = 10 分,accuracy 0.0 = 0 分。
使用 F1-Macro 指标进行评估。
提交文件必须为 CSV 格式,包含以下列:
1。test.csv 中 ID 列的值。subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...注意: 解决此问题不需要使用 Transformer 架构(例如:RoBERTa)。