加载中...
难度
您的最佳成绩
不适用
在全球化的世界中,消息来自世界各个角落,可能用各种语言编写。为了自动处理这些文本(例如,在自动翻译应用程序中),识别每个文本的语言是至关重要的。
你的任务是开发一个自动系统,能够确定文本的语言,从基于标记示例集训练模型开始。
自动系统需要支持以下语言:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
你有两个CSV文件:
train.csv中的每一行包含以下列:
SampleID - 文本的唯一标识符Text - 原始文本language - 文本的语言示例:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", Dutchtest.csv中的每一行包含以下列:
SampleID - 文本的唯一标识符Text - 需要预测语言的文本示例:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."构建一个系统,能够识别test.csv中文本的语言。
预测结果需要保存在submission.csv文件中,格式如下:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedish其中:
SampleID - test.csv中文本的唯一标识符language - 你的系统预测的语言,必须是以下可能语言列表中的一种:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
预测结果将与真实语言进行比较,计算准确率:
accuracy = (正确预测数量 / 总预测数量)最终分数基于获得的准确率,使用以下规则计算: