רמת קושי
הציון הטוב ביותר שלך
לא זמין
בעולם גלובלי, הודעות מגיעות מכל קצוות העולם ויכולות להיות כתובות בשפות שונות. כדי לעבד אוטומטית את הטקסטים הללו (למשל, באפליקציות תרגום אוטומטיות) חיוני שנוכל לזהות את השפה של כל טקסט.
התפקיד שלך הוא לפתח מערכת אוטומטית המסוגלת לקבוע את השפה של טקסט, החל מאימון מודל על בסיס קבוצת דוגמאות מתויגות.
המערכת האוטומטית צריכה לפעול עבור השפות הבאות:
Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
יש לך שני קבצי CSV:
כל שורה ב-train.csv כוללת את העמודות הבאות:
SampleID - המזהה הייחודי של הטקסטText - הטקסט המקוריlanguage - שפת הטקסטדוגמה:
SampleID,Text,languageS1,"klement gottwaldi surnukeha palsameeriti ning ...",EstonianS2,"sebes joseph pereira thomas på eng the jesuit...",SwedishS3,"de spons behoort tot het geslacht haliclona en...", Dutchכל שורה ב-test.csv כוללת את העמודות הבאות:
SampleID - המזהה הייחודי של הטקסטText - הטקסט שצריך לחזות את השפה שלודוגמה:
SampleID,TextS1001,"ถนนเจริญกรุง อักษรโรมัน thanon charoen krung เ..."S1002,"விசாகப்பட்டினம் தமிழ்ச்சங்கத்தை இந்துப் பத்திர..."בנה מערכת שיכולה לזהות את שפת הטקסט עבור הטקסטים ב-test.csv.
התחזיות צריכות להישמר בקובץ submission.csv בפורמט:
SampleID,languageS1001,ThaiS1002,TamilS1003,Swedishכאשר:
SampleID - המזהה הייחודי של הטקסט מ-test.csvlanguage - השפה שחוזה המערכת שלך, שצריכה להיות אחת מהשפות האפשריות מהרשימה הבאה:Swedish, French, Korean, Japanese, Portugese, English, Persian, Pushto, Thai, Romanian, Tamil, Spanish, Turkish, Estonian, Chinese, Arabic, Urdu, Hindi, Latin, Russian, Indonesian, Dutch
התחזיות יושוו עם השפות האמיתיות ותחושב הדיוק:
accuracy = (מספר_תחזיות_נכונות / מספר_כולל_תחזיות)הציון הסופי מחושב על בסיס הדיוק שהושג באמצעות הכללים הבאים: