الصعوبة
أفضل نتيجة لك
غير متوفر
على مر السنين، تقدم نتائج امتحان البكالوريا صورة مفصلة عن أداء المدارس الثانوية في رومانيا. من خلال تحليل البيانات التاريخية على مدى عدة سنوات، يمكننا اكتشاف الاتجاهات وتطور الأداء المدرسي، وأحياناً، النتائج التي تخرج عن المألوف.
في هذا السياق، الهدف من هذه المسألة هو تحليل أداء المدارس الثانوية في البكالوريا إحصائياً، وبناء نماذج تنبؤية وتحديد النتائج غير النمطية باستخدام طرق التعلم الآلي.
لحل متطلبات هذه المسألة لديكم إمكانية الوصول إلى مجموعة بيانات منظمة في شكل ملفين csv: train.csv و test.csv. تحتوي مجموعة البيانات هذه على نتائج مجمعة للمدارس الثانوية في مختلف اختبارات امتحان البكالوريا، للفترة 2014–2023.
كل صف في مجموعة البيانات (سواء كان في مجموعة التدريب أو الاختبار) يمثل نتائج مدرسة ثانوية، لـ مادة، في سنة.
id – معرف فريد للصفan – سنة الامتحانliceu – اسم المدرسة الثانويةjudet – المحافظة التي تقع فيها المدرسة الثانويةmaterie – مادة البكالورياmedie – متوسط الدرجات التي حصل عليها طلاب المدرسة الثانوية في المادة المعنيةprocent_reusita – نسبة الطلاب الذين نجحوا في الاختبارnumar_candidati – عدد المرشحينpreferinta_materie – نسبة الطلاب الذين اختاروا المادة المعنيةanomalie - يمكن أن تأخذ القيمة 0 إذا لم تُعتبر حالة غير طبيعية أو القيمة 1 إذا كانت الحالة غير عادية.ملاحظة: لكل مدرسة ثانوية لدينا أيضاً بعض الإحصائيات العامة. بالنسبة لتلك، في عمود materie نجد القيمة GENERAL.
يحتوي ملف train.csv على الإحصائيات من الفترة 2014-2022، بينما يحتوي ملف test.csv على البيانات لسنة 2023، لكن عمودي medie و anomalie غير متاحين.
حددوا ما هي المادة التي حصلت على أعلى تفضيل في سنة 2023 من COLEGIUL NATIONAL "UNIREA" FOCSANI، إذا استثنينا مادة LIMBA ROMANA التي كانت إجبارية لجميع المرشحين.
حددوا في أي سنة من الفترة 2014-2022 حصلت مادة INFORMATICA MI C-C++ على أعلى شعبية في COLEGIUL NATIONAL "UNIREA" FOCSANI. نعتبر أن الشعبية تُحدد بالنسبة المئوية من عمود preferinta_materie (كلما كانت هذه النسبة أعلى، كلما اعتبرنا أن المادة كانت أكثر شعبية).
باستخدام المعلومات المتاحة في ملف train.csv، قدروا قيمة المتوسط المحصل عليه لكل صف في ملف test.csv (سنة 2023).
لهذا المتطلب يمكنكم استخدام أي طريقة تحليل إحصائي أو نمذجة مبنية على البيانات التاريخية، مع مراعاة:
الهدف هو الحصول على تقديرات أقرب ما يمكن إلى القيم الحقيقية.
حللوا البيانات التاريخية من الفترة 2014–2022 وقرروا، لكل صف في ملف test.csv، إذا كانت النتيجة المقابلة لسنة 2023 هي:
في اتخاذ القرار يمكنكم مراعاة:
النتيجة النهائية لكل صف يجب أن تكون تسمية ثنائية:
0 - نتيجة طبيعية1 - نتيجة غير نمطيةللتقييم التلقائي يجب أن تحملوا ملفاً بتنسيق csv بالهيكل التالي:
id – معرف الصف (المقابل لذلك في test.csv)
ididsubtaskID – معرف المتطلب:
1 لتحديد المادة المفضلة (المتطلب 1)2 لتحديد السنة المزدهرة للمعلوماتية (المتطلب 2)3 لتقدير المتوسط (المتطلب 3)4 لتحديد النتائج غير النمطية (المتطلب 4)answer – الإجابة المقابلة للمتطلب:
subtaskID = 1: اسم المادة تماماً كما يظهر في مجموعة البياناتsubtaskID = 2: السنةsubtaskID = 3: قيمة رقمية (تقدير المتوسط)subtaskID = 4: 0 أو 1للمتطلبين 1–2 يتم التقييم بدقة (من خلال المقارنة).
للمتطلب 3 يتم التقييم باستخدام Mean Absolute Error (MAE).
القواعد:
للمتطلب 4، تُمنح النقاط وفقاً للقواعد التالية: