الصعوبة
أفضل نتيجة لك
غير متوفر
الغرض من هذه المشكلة هو تحديد وتصنيف النصوص وفقاً للخصوصية الإقليمية أو الشكل القياسي للغة الرومانية. تحتوي مجموعة البيانات على مقتطفات نصية تم جمعها من مناطق مختلفة.
| العمود | الوصف |
|---|---|
| ID | معرف فريد لكل مقتطف نصي |
| text | المحتوى الفعلي للجملة باللغة الرومانية |
| label | تصنيف لهجة النص (العمود المستهدف) |
ملاحظة: عمود label (اللهجة) متاح فقط في بيانات التدريب (train.csv). الفئات الثلاث الممكنة هي: româna standard (الرومانية القياسية)، graiul moldovenesc (اللهجة المولدافية)، و graiul bănățean (لهجة بانات).
تم استخراج جزء من النصوص من عمل "Cinci pâini" للكاتب Ion Creangă. احسب العدد الإجمالي لمرات ظهور كلمة "pâni" (الشكل القديم لكلمة "pâini") في ملفي train.csv و test.csv.
في ملف train.csv احسب متوسط عدد علامات الترقيم للنصوص في graiul moldovenesc و graiul bănățean. أرجع القيمة المطلقة للفرق بين القيمتين، مقربة إلى منزلتين عشريتين.
لكل صف في test.csv احسب عدد الحروف ذات العلامات التشكيلية (diacritics) في النص. الحروف المعتبرة هي: ă ، â ، î ، ș ، ț (والأشكال الكبيرة منها Ă ، Â ، Î ، Ș ، Ț).
قم ببناء نموذج قادر على تصنيف النصوص في ملف الاختبار بشكل صحيح إلى واحدة من الفئات الثلاث.
يتم التقييم من خلال التحقق الدقيق من الإجابة. إجابة صحيحة = الدرجة الكاملة، إجابة خاطئة = 0 نقطة.
يتم التقييم من خلال accuracy (الدقة) — نسبة الإجابات الصحيحة من الإجمالي. الدرجة تناسبية: دقة 1.0 = 10 نقاط، دقة 0.0 = 0 نقطة.
يتم التقييم باستخدام مقياس F1-Macro.
يجب أن يكون ملف التسليم بتنسيق CSV، ويحتوي على الأعمدة التالية:
1.ID في ملف test.csv.subtaskID,datapointID,answer1,1,322,1,5.073,101,23,102,43,103,2...4,101,româna standard4,102,graiul moldovenesc4,103,graiul bănățean...ملاحظة: حل هذه المشكلة لا يتطلب استخدام معماريات من نوع Transformer (مثل: RoBERTa).