الصعوبة
أفضل نتيجة لك
غير متوفر
في عالم موازٍ، FairPlay هو القسم المسؤول عن مراقبة الفرق واللاعبين أثناء المباريات.
على مر السنين، لاحظ FairPlay أن مباريات معينة تميل إلى أن تصبح فوضوية أكثر عندما تظهر:
لتجنب الفضائح قدر الإمكان، يطلب منك FairPlay بناء نموذج يصنف المباريات حسب إمكانية الفوضى.
لديك بيانات من الماضي حول المباريات ويجب أن تبني نموذج تصنيف يمكنه التنبؤ بما إذا كانت المباراة ستصبح فوضوية.
تم توفير ملفين لك:
train.csv - مباريات من الماضي، مع تسمية chaos_labeltest.csv - مباريات جديدة، بدون تسميةكل صف يمثل مباراة ويحتوي على الأعمدة التالية:
MatchID - معرف فريد للمباراةSeason - الموسم التنافسيMatchWeek - الجولةHomeTeam - الفريق المضيفAwayTeam - الفريق الضيفGoals - العدد الإجمالي للأهدافShots - العدد الإجمالي للتسديداتCorners - العدد الإجمالي للركنياتYellowCards - عدد البطاقات الصفراءRedCards - عدد البطاقات الحمراءTeamStyles - قائمة بأساليب اللعب المرتبطة بالمباراة (مثل: ["AggressiveTackler", "HighPressure"])chaos_label - فقط في train.csv،
التنبؤ بما إذا كانت مباراة من test.csv فوضوية (قيم ثنائية - 0 أو 1).
أول مهمتين فرعيتين تتحققان من فهم ومعالجة البيانات.
المهمة الفرعية الأخيرة تقيم أداء نموذج التصنيف.
احسب عدد المباريات التي لعبها فريق "Chelsea"، سواء خارج الديار أو في الديار.
اعرض رقماً صحيحاً واحداً.
بدءاً من عمود TeamStyles، احسب نقاطاً رقمية تسمى StyleAggressionScore، معرفة كـ:
StyleAggressionScore = (عدد الأساليب العدوانية) / (العدد الإجمالي للأساليب)الأساليب المعتبرة عدوانية هي:
AggressiveTacklerRiskTakerHighPressureChaosInducerيجب أن تكون النتيجة رقماً حقيقياً بين 0 و 1.
ابن نموذج تصنيف يتنبأ بما إذا كانت المباراة فوضوية (chaos_label = 1) أو منضبطة (chaos_label = 0).
لكل صف في test.csv، يجب أن يعيد النموذج تنبؤاً ثنائياً:
يمكن للنموذج استخدام أي ميزة متاحة في مجموعة البيانات، بما في ذلك الميزات الاصطناعية المبنية في إطار المهام الفرعية السابقة.
للمهمة الفرعية 3، يتم التقييم باستخدام نقاط F1 macro.
يتم حساب نقاط F1 macro كما يلي:
هذا المقياس يعامل كلا الفئتين بالتساوي ويعاقب النماذج التي تتنبأ بشكل صحيح فقط بالفئة الأكثرية.
عتبات التقييم:
القيم الوسطية تحصل على نقاط متناسبة.
يجب أن يحتوي ملف submission.csv على سطر واحد للمهمة الفرعية الأولى، وسطرين لكل صف من test، مقابل المهمتين الفرعيتين الأخريين.
البنية:
subtaskID,datapointID,answerحيث:
subtaskID - 1، 2 أو 3datapointID - قيمة id (أو 1 للمهمة الفرعية الأولى)answer - يعتمد على المهمة:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
مصدر مجموعة البيانات: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv