الصعوبة
أفضل نتيجة لك
غير متوفر
في عالم معولم، تأتي الرسائل من جميع أنحاء العالم ويمكن أن تكون مكتوبة بلغات متنوعة. لمعالجة هذه النصوص تلقائياً (على سبيل المثال، في تطبيقات الترجمة الآلية) من الضروري أن نتمكن من تحديد لغة كل نص.
دورك هو تطوير نظام تلقائي قادر على تحديد لغة النص، بدءاً من تدريب نموذج بناءً على مجموعة من الأمثلة المُصنفة.
يجب أن يعمل النظام التلقائي للغات التالية:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
لديك ملفان CSV:
كل صف في train.csv يحتوي على الأعمدة التالية:
SampleID - المعرف الفريد للنصText - النص الأصليlanguage - لغة النصمثال:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", Dutchكل صف في test.csv يحتوي على الأعمدة التالية:
SampleID - المعرف الفريد للنصText - النص الذي يجب التنبؤ بلغتهمثال:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."اقم ببناء نظام يمكنه تحديد لغة النص للنصوص في test.csv.
يجب حفظ التنبؤات في ملف submission.csv بالتنسيق:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishحيث:
SampleID - المعرف الفريد للنص من test.csvlanguage - اللغة المتنبأ بها من نظامك، والتي يجب أن تكون واحدة من اللغات المحتملة من القائمة التالية:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
ستتم مقارنة التنبؤات مع اللغات الحقيقية وسيتم حساب الدقة:
accuracy = (عدد_التنبؤات_الصحيحة / العدد_الإجمالي_للتنبؤات)يتم حساب النتيجة النهائية بناءً على الدقة المحققة باستخدام القواعد التالية: