רמת קושי
הציון הטוב ביותר שלך
לא זמין
החברה שלך רוצה להגן על המשתמשים מפני דוא"ל לא רצוי (ספאם).
לשם כך, הוחלט לבנות מערכת אוטומטית שתזהה
דוא"ל ספאם ותפריד אותו מהדוא"ל הלגיטימי (לא ספאם).
קיבלת סט של דוא"ל מתויגים ועליך לבנות מודל
שיוכל לסווג דוא"ל חדש.
הועמדו לרשותך שני קבצים:
label (spam = 1 / nonspam = 0)המטרה העיקרית: חיזוי הסתברות שדוא"ל הוא ספאם (ערך בין 0 ל-1, כאשר 0 = לא ספאם בוודאות, 1 = ספאם בוודאות).
כל שורה מייצגת דוא"ל, עם התכונות הבאות:
sample_id - מזהה ייחודיtext - תוכן הדוא"לlabel - רק ב-train.csv, 1 (ספאם)/ 0 (לא ספאם)המטרה הסופית: חזה label עבור השורות ב-test.csv.
שתי המשימות הראשונות בודקות ניתוח פשוט של הדוא"ל.
המשימה האחרונה מעריכה את מודל הסיווג.
קבע את אורך כל דוא"ל כמספר תווים.
הצג עבור משימה זו מספר שלם.
ספור כמה הופעות של המילה free קיימות בדוא"ל.
בנה מודל סיווג שחוזה את ההסתברות שדוא"ל הוא ספאם (p ∈ [0,1]) עבור כל שורה בבדיקה.
ההערכה נעשית באמצעות עקומת ROC ו-AUC (Area Under the ROC Curve).
משימות 1–2 מוערכות בדיוק (באמצעות השוואה).
הקובץ submission.csv חייב להכיל 3 שורות עבור כל שורה בבדיקה,
המתאימות ל-3 המשימות.
מבנה:
subtaskID, datapointID, answerכאשר:
sample_idfree (מספר שלם)sample_id = 00042:subtaskID,datapointID,answer1,00042,3422,00042,33,00042,0.742עבור משימה 3, ההערכה נעשית באמצעות ROC AUC (Area Under the ROC Curve).
זהו מדד יחיד המסכם את הביצועים של מסווג עבור כל הספים האפשריים להחלטה.

