רמת קושי
הציון הטוב ביותר שלך
לא זמין
מטרת בעיה זו היא לזהות ולסווג טקסטים בהתאם למאפיינים אזוריים או לצורה הסטנדרטית של השפה הרומנית. מערך הנתונים מכיל קטעי טקסט שנאספו מאזורים שונים.
| עמודה | תיאור |
|---|---|
| ID | מזהה ייחודי לכל קטע טקסט |
| text | התוכן עצמו של המשפט בשפה הרומנית |
| label | סיווג הניב של הטקסט (עמודת היעד) |
הערה: העמודה label (הניב) זמינה רק בנתוני האימון (train.csv). שלוש המחלקות האפשריות הן: româna standard (רומנית סטנדרטית), graiul moldovenesc (ניב מולדובני) ו-graiul bănățean (ניב באנאטי).
חלק מהטקסטים חולצו מהיצירה "Cinci pâini" מאת יון קריאנגה (Ion Creangă). חשב את מספר המופעים הכולל של המילה "pâni" (הצורה הארכאית של המילה "pâini") בקבצים train.csv ו-test.csv.
בקובץ train.csv, חשב את ממוצע מספר סימני הפיסוק עבור טקסטים ב-graiul moldovenesc וב-graiul bănățean. החזר את הערך המוחלט של ההפרש בין שני הערכים, כשהוא מעוגל ל-2 ספרות אחרי הנקודה.
עבור כל שורה ב-test.csv, חשב את מספר הדיאקריטים (סימני הניקוד) בטקסט. התווים הנחשבים לדיאקריטים הם: ă, â, î, ș, ț (והגרסאות שלהם באותיות גדולות Ă, Â, Î, Ș, Ț).
בנה מודל המסוגל לסווג נכון את הטקסטים מקובץ הבדיקה לאחת מ-3 המחלקות.
ההערכה מתבצעת על ידי בדיקה מדויקת של התשובה. תשובה נכונה = ניקוד מקסימלי, תשובה שגויה = 0 נקודות.
ההערכה מתבצעת לפי accuracy — יחס התשובות הנכונות מתוך הסך הכל. הניקוד הוא יחסי: accuracy 1.0 = 10 נקודות, accuracy 0.0 = 0 נקודות.
ההערכה מתבצעת באמצעות מדד F1-Macro.
קובץ ההגשה חייב להיות בפורמט CSV, ולהכיל את העמודות הבאות:
1.ID ב-test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...הערה: פתרון בעיה זו אינו מחייב שימוש בארכיטקטורות מסוג Transformer (למשל: RoBERTa).