רמת קושי
הציון הטוב ביותר שלך
לא זמין
על רקע אי-הוודאות הקשורה לאינפלציה, מוסד בנקאי עורך קמפיין שיווק טלפוני כדי לשכנע לקוחות לפתוח פיקדונות לזמן קצוב. לאחר תוכנית קידום מכירות ארוכה, החברה מעוניינת להעריך את יעילות הקמפיין. סט הנתונים מכיל מידע על לקוחות, מאפיינים דמוגרפיים ופרטים על השיחות שבוצעו במסגרת קמפיין השיווק. מטרת הבעיה היא לנתח נתונים אלו ולפתור מספר תתי-משימות הקשורות להתנהגות הלקוחות.
המשתתפים מקבלים שלושה קבצים:
deposit.deposit.| עמודה | תיאור |
|---|---|
id | מזהה (ID) |
age | גיל הלקוח |
job | מקצוע הלקוח |
marital | מצב משפחתי |
education | רמת השכלה |
default | האם הלקוח נכנס אי פעם לחדלות פירעון (default) |
balance | יתרת החשבון |
housing | האם ללקוח יש משכנתא |
loan | האם ללקוח יש הלוואה אישית |
contact | סוג יצירת הקשר |
day | יום השיחה |
month | חודש השיחה |
duration | משך השיחה |
campaign | מספר השיחות בקמפיין |
pdays | מספר הימים שחלפו מהקמפיין הקודם |
previous | מספר המגעים הקודמים |
poutcome | תוצאת הקמפיין הקודם |
deposit | משתנה המטרה: האם הלקוח פתח פיקדון |
הבעיה מחולקת לארבע תתי-משימות.
קבעו את המקצוע (job) עם שיעור ההפקדות הגבוה ביותר.
שיעור ההפקדות מייצג את שיעור הלקוחות עבורם deposit = 1 מתוך סך הלקוחות באותו מקצוע.
Output: המקצוע.
קבעו את החודש (month) שבו נוצר קשר טלפוני עם מספר הלקוחות הגבוה ביותר בסט הנתונים לאימון.
Output: שם החודש.
בנו מודל סיווג בינארי החוזה את המשתנה deposit.
יש לאמן את המודל באמצעות train.csv ועליו לייצר תחזיות עבור test.csv.
קבצו את הלקוחות ב-test.csv לשני אשכולות (clusters) על בסיס המשתנים המספריים והחזירו עבור כל לקוח את תווית האשכול אליו הוא שייך.
הפתרון חייב לייצר קובץ submission.csv במבנה הבא:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...הסברים:
datapointID תכיל את הערך 1.datapointID תכיל את הערך של ה-id מתוך test.csv.תת-משימה 1 — בדיקה מדויקת של התשובה.
תת-משימה 2 — בדיקה מדויקת של התשובה.
תת-משימה 3 — הסיווג מוערך באמצעות F1 macro:
| F1 macro | ניקוד |
|---|---|
| 0.85 =< | ניקוד מקסימלי (55 נק') |
| 0.65 > | 0 נקודות |
| בין הערכים | ניקוד יחסי |
תת-משימה 4 — האשכול (Clustering) מוערך באמצעות Adjusted Rand Index (ARI):
| ARI | ניקוד |
|---|---|
| 0.9 =< | ניקוד מקסימלי (20 נק') |
| 0.5 > | 0 נקודות |
| בין הערכים | ניקוד יחסי |