الصعوبة
أفضل نتيجة لك
غير متوفر
في عالم موازٍ للشبكات الاجتماعية، Chirper هي أشهر منصة للرسائل المصغرة.
مؤخراً، تم شراء المنصة من قبل الشهير (والغريب الأطوار قليلاً) Melon Husk، الذي قرر إعادة تسميتها باسم Y.
لجعل Y أكثر نظافة وودية، يطلب Melon Husk من فريق علوم البيانات الخاص بك بناء نموذج تصنيف يكتشف تلقائياً chirp-ات إشكالية (spam، محتوى غير ذي صلة أو ضوضاء)، بحيث يمكن تصفيتها من التغذية.
لقد تلقيت مجموعة من chirp-ات تاريخية وتحتاج إلى بناء نموذج
يمكنه تصنيف chirp-ات جديدة.
تم توفير ملفين لك:
label (problematic = 1 / normal = 0)الهدف الرئيسي: التنبؤ بالاحتمالية أن يكون chirp إشكالياً
(قيمة بين 0 و 1، حيث 0 = chirp عادي بالتأكيد، 1 = chirp إشكالي بالتأكيد).
كل صف يمثل chirp منشور على Chirper Y، مع الخصائص التالية:
id – معرف فريد للـ chirpchirp – نص الـ chirplabel – فقط في train.csv، 1 (إشكالي) / 0 (عادي)الهدف النهائي: التنبؤ بـ label للصفوف في test.csv.
أول مهمتين فرعيتين تتحققان من التحليل البسيط للـ chirp-ات.
المهمة الفرعية الأخيرة تقيم أداء نموذج التصنيف.
حدد طول كل chirp كعدد من الأحرف.
اعرض لهذه المهمة الفرعية رقماً صحيحاً.
احسب كم مرة يظهر الحرف # في الـ chirp
(مؤشر مهم للهاشتاغات المفرطة، المحبوبة من قبل المرسلين العشوائيين 😄).
ابنوا نموذج تصنيف يتنبأ بالاحتمالية أن يكون chirp
إشكالياً (p ∈ [0,1]) لكل صف في الاختبار.
التقييم يتم باستخدام منحنى ROC و AUC (المساحة تحت منحنى ROC).
المهام الفرعية 1–2 تُقيم بدقة (من خلال المقارنة).
يجب أن يحتوي ملف submission.csv على 3 أسطر لكل صف في الاختبار،
مقابلة للمهام الفرعية الثلاث.
البنية:
subtaskID,datapointID,answerحيث:
حيث:
id# (رقم صحيح)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083لـ المهمة الفرعية 3، يتم التقييم باستخدام ROC AUC (المساحة تحت منحنى ROC).
هذا مقياس فريد يلخص أداء مصنف
لجميع عتبات القرار الممكنة.
يُرسم منحنى ROC، الذي يمثل:
المساحة تحت المنحنى (AUC) تُحسب باستخدام قاعدة شبه المنحرف:
تفسير النتيجة: