רמת קושי
הציון הטוב ביותר שלך
לא זמין
מטרת בעיה זו היא לזהות עסקאות הונאה בכרטיסי אשראי על בסיס סט נתונים אמיתי ואנונימי. הבעיה משקפת תרחיש מהעולם האמיתי, שבו הנתונים אינם מאוזנים בצורה קיצונית ועסקאות הונאה הן נדירות.
הפרויקט משתמש בשני קובצי CSV:
train.csv - סט הנתונים לאימוןtest.csv - סט הנתונים לבדיקה| עמודה | תיאור |
|---|---|
| id | מזהה ייחודי לכל עסקה |
| Time | מספר השניות שחלפו מהעסקה הראשונה |
| V1 - V28 | מאפיינים אנונימיים |
| Amount | סכום העסקה |
| Class | משתנה המטרה (0 = עסקה לגיטימית, 1 = הונאה) |
הערה: העמודה Class זמינה רק ב-train.csv.
הערה חשובה: סט הנתונים אינו מאוזן באופן חמור, ולכן accuracy אינו מדד רלוונטי להערכת מודלי סיווג.
קבע כמה עסקאות הונאה הן בעלות Amount גבוה יותר מהממוצע של ה-Amount בעסקאות לגיטימיות.
התשובה היא מספר שלם.
הערך עד כמה עסקאות ההונאה הן "חריגות" באמצעות מרחק מהלנוביס, הלוקח בחשבון את כל המשתנים המספריים בו-זמנית (Amount + V1-V28).
שלבים מוצעים:
Class = 1) מתוך train.csv.עבור כל עסקה ב-test.csv, חזה את תווית ההונאה:
1 = הונאה0 = עסקה לגיטימיתמדד עיקרי: F1-score על מחלקה 1.
| F1-score | ניקוד |
|---|---|
| F1 >= 0.85 | 80 נקודות |
| F1 < 0.60 | 0 נקודות |
| ביניים | שקלול ליניארי בין 0 ל-80 |
קובץ ההגשה חייב להיות בפורמט CSV עם העמודות הבאות:
| עמודה | תיאור |
|---|---|
| subtaskID | מספר תת-המשימה (1, 2 או 3) |
| datapointID | מזהה התצפית |
| answer | התשובה או החיזוי |
כללים:
datapointID = 1 (תשובה אחת בלבד).test.csv, כאשר datapointID = הערך בעמודת ה-id.דוגמה:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0הערה: פתרון בעיה זו אינו מחייב שימוש בארכיטקטורות מסוג Transformer.