مسألة #39
المؤلف:Mihai Nan
الصعوبة
أفضل نتيجة لك
غير متوفر
في مكتبة المملكة العظمى، يواجه أمناء المحفوظات مهمة تزداد صعوبة:
آلاف المخطوطات والرقوق والسجلات القديمة تحتاج إلى تنظيم ومقارنة وفهرسة.
لمساعدتهم، أنشأ الأسلاف آلية أسطورية: عرّاف التشابه. هذا هو
جهاز قادر على تحديد، بدقة ملحوظة، مدى تشابه
جزأين من النص، مُرجعاً نقاطاً بين 0 و 5.
لكن الآلية تدهورت مع الزمن، وقرر المجلس الأعظم لأمناء المحفوظات أن هناك حاجة
لنسخة حديثة، مبنية باستخدام التعلم الآلي.
لهذا الغرض، تم وضع ملفين تحت تصرفك:
train.csv - الرقوق المُعلّقة يدوياً من قبل الكتبةtest.csv - أزواج جديدة تحتاج إلى تحليل من حلكمهمتك هي إعادة بناء العرّاف من خلال سلسلة من التحليلات ونموذج تنبؤي نهائي.
كل صف في ملفي train.csv و test.csv يمثل زوجاً من الجمل:
الهدف النهائي هو التنبؤ بـ score لكل صف في test.csv.
للمهام الفرعية الأولى، يجب أن تحلل البيانات المقدمة في train.csv و test.csv
وتستخرج معلومات مختلفة ذات صلة حول الجمل في الاختبار.
احسب طول كل جملة (sentence1 و sentence2) لكل صف في مجموعة الاختبار
وصنف الزوج حسب الطول المتوسط:
Short إذا كان المتوسط < 50Medium إذا كان 50 ≤ المتوسط < 100Long إذا كان المتوسط ≥ 100لكل صف في test، احسب عدد الكلمات في كل جملة (sentence1 و sentence2) وحدد العدد الإجمالي حسب الصيغة:
العدد_الإجمالي = عدد_كلمات(sentence1) + عدد_كلمات(sentence2)حدد الفرق المطلق بين طول sentence1 وطول sentence2
لكل صف في test.
بمعنى آخر، لكل صف يجب أن نحسب:
|عدد_أحرف(sentence1) - عدد_أحرف(sentence2)|ابن نموذج تعلم آلي قادر على التنبؤ بالقيمة العددية score
لكل صف في test.csv.
التقييم النهائي سيتم باستخدام MAE (Mean Absolute Error)، محسوب كما يلي:
المقياس للمهمة الفرعية 4 هو:
للمهام الفرعية 1-3، تُقيّم الإجابات بدقة.
ملف submission.csv يجب أن يحتوي على 4 أسطر لكل صف في الاختبار،
مقابلة للمهام الفرعية الأربع.
الهيكل:
subtaskID datapointID answerمعنى الأعمدة:
subtaskID – رقم بين 1 و 4
datapointID – sampleID من الاختبار
answer – النتيجة:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74حظاً موفقاً! المجلس الأعظم لأمناء المحفوظات يضع آماله فيكم لإحياء عرّاف التشابه! 🧙♂️