רמת קושי
הציון הטוב ביותר שלך
לא זמין
בעולם מקביל של רשתות חברתיות, Chirper היא הפלטפורמה הפופולרית ביותר למיקרו-הודעות.
לאחרונה, הפלטפורמה נרכשה על ידי מלון האסק המפורסם (והמעט אקסצנטרי), שהחליט למתג אותה מחדש תחת השם Y.
כדי להפוך את Y לנקייה וידידותית יותר, מלון האסק מבקש מצוות מדעני הנתונים שלך לבנות מודל סיווג שיזהה אוטומטית chirp-ים בעייתיים (ספאם, תוכן לא רלוונטי או רעש), כך שניתן יהיה לסנן אותם מהפיד.
קיבלת סט של chirp-ים היסטוריים ועליך לבנות מודל
שיוכל לסווג chirp-ים חדשים.
הועמדו לרשותך שני קבצים:
label (problematic = 1 / normal = 0)המטרה העיקרית: חיזוי ההסתברות שchirp יהיה בעייתי
(ערך בין 0 ל-1, כאשר 0 = chirp בטוח רגיל, 1 = chirp בטוח בעייתי).
כל שורה מייצגת chirp שפורסם ב-Chirper Y, עם המאפיינים הבאים:
id – מזהה ייחודי של ה-chirpchirp – טקסט ה-chirplabel – רק ב-train.csv, 1 (בעייתי) / 0 (רגיל)המטרה הסופית: חזה label עבור השורות ב-test.csv.
שתי המשימות הראשונות בודקות ניתוח פשוט של ה-chirp-ים.
המשימה האחרונה מעריכה את ביצועי מודל הסיווג.
קבע את אורך כל chirp כמספר תווים.
הצג עבור משימה זו מספר שלם.
ספור כמה הופעות של התו # קיימות ב-chirp
(אינדיקטור חשוב להאשטגים מוגזמים, אהובים על ספאמרים 😄).
בנו מודל סיווג שחוזה את ההסתברות שchirp
יהיה בעייתי (p ∈ [0,1]) עבור כל שורה בtest.
ההערכה נעשית באמצעות עקומת ROC ו-AUC (Area Under the ROC Curve).
משימות 1–2 מוערכות בדיוק (על ידי השוואה).
הקובץ submission.csv חייב להכיל 3 שורות עבור כל שורה בtest,
המתאימות ל-3 המשימות.
מבנה:
subtaskID,datapointID,answerכאשר:
כאשר:
id# (מספר שלם)id = 25758:subtaskID,datapointID,answer1,25758,212,25758,03,25758,0.083עבור משימה 3, ההערכה נעשית באמצעות ROC AUC (Area Under the ROC Curve).
זהו מדד יחיד שמסכם את ביצועי מסווג
עבור כל הספים האפשריים להחלטה.
מתוותת עקומת ROC, המייצגת:
השטח מתחת לעקומה (AUC) מחושב באמצעות כלל הטרפזים:
פרשנות הציון: