الصعوبة
أفضل نتيجة لك
غير متوفر
الهدف من هذه المشكلة هو تحديد المعاملات الاحتيالية للبطاقات الائتمانية بناءً على مجموعة بيانات حقيقية ومجهولة الهوية. تعكس المشكلة سيناريو من العالم الحقيقي، حيث تكون البيانات غير متوازنة بشكل كبير والمعاملات الاحتيالية نادرة.
يستخدم المشروع ملفي CSV:
train.csv - مجموعة بيانات التدريبtest.csv - مجموعة بيانات الاختبار| العمود | الوصف |
|---|---|
| id | معرف فريد لكل معاملة |
| Time | عدد الثواني المنقضية منذ أول معاملة |
| V1 - V28 | ميزات مجهولة الهوية |
| Amount | قيمة المعاملة |
| Class | المتغير المستهدف (0 = معاملة مشروعة، 1 = احتيال) |
ملاحظة: العمود Class متاح فقط في train.csv.
ملاحظة هامة: مجموعة البيانات غير متوازنة للغاية، لذا فإن الدقة (accuracy) ليست المقياس المناسب لتقييم نماذج التصنيف.
حدد عدد المعاملات الاحتيالية التي يكون فيها Amount أكبر من متوسط Amount للمعاملات المشروعة.
الإجابة هي رقم صحيح.
قم بتقييم مدى كون المعاملات الاحتيالية "غير طبيعية" باستخدام مسافة ماهالانوبيس، والتي تأخذ في الاعتبار جميع المتغيرات الرقمية في وقت واحد (Amount + V1-V28).
الخطوات المقترحة:
Class = 1) من train.csv.لكل معاملة في test.csv ، توقع تسمية الاحتيال:
1 = احتيال0 = معاملة مشروعةالمقياس الرئيسي: F1-score للفئة 1.
| F1-score | النقاط |
|---|---|
| F1 >= 0.85 | 80 نقطة |
| F1 < 0.60 | 0 نقطة |
| بينهما | قياس خطي بين 0 و 80 |
يجب أن يكون ملف التسليم بتنسيق CSV مع الأعمدة التالية:
| العمود | الوصف |
|---|---|
| subtaskID | رقم المهمة الفرعية (1، 2 أو 3) |
| datapointID | معرف الملاحظة |
| answer | الإجابة أو التوقع |
القواعد:
datapointID = 1 (إجابة واحدة فقط).test.csv ، مع datapointID = القيمة الموجودة في عمود id.مثال:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0ملاحظة: حل هذه المشكلة لا يتطلب استخدام بنيات من نوع Transformer.