רמת קושי
הציון הטוב ביותר שלך
לא זמין
מערכת של סוכנות עיתונות בינלאומית מנהלת מדי יום אלפי מאמרים המגיעים מתחומים מגוונים: כלכלה, פוליטיקה, מדע, טכנולוגיה וסביבה. כדי לוכל לארכב ולהפיץ במהירות את המידע, כל מאמר צריך להיות מסווג לקטגוריה נושאית.
בגלל תקלה טכנית, התוויות של מאמרים אחרונים אבדו. המערכת פונה אליך כדי לבנות מערכת חכמה שתוכל לסווג אוטומטית מאמרי חדשות על בסיס התוכן שלהם.
ניתנים שני קבצי קלט:
train.csv – מכיל מאמרי חדשות שהקטגוריה שלהם ידועהtest.csv – מכיל מאמרי חדשות ללא קטגוריהכל מאמר מזוהה באמצעות id ייחודי ויש לו טקסט משויך.
באמצעות הנתונים מ-train.csv, עליך לבנות מודל סיווג שיחזה את התווית (label) של כל מאמר ב-test.csv.
התוצאה תישמר בקובץ submission.csv.
train.csvמכיל את העמודות הבאות:
id – מזהה ייחודי של המאמר (string, לדוגמה 000001)text – תוכן המאמרlabel – קטגוריית המאמר (מספר שלם)דוגמה:
id,text,label000001,"Wall St. Bears Claw Back Into the Black (Reuters)...",2000002,"Carlyle Looks Toward Commercial Aerospace (Reuters)...",2000003,"Oil and Economy Cloud Stocks' Outlook (Reuters)...",2test.csvמכיל את העמודות הבאות:
id – מזהה ייחודיtext – תוכן המאמרדוגמה:
id,text120001,"Fears for T N pension after talks Unions represent..."120002,"The Race is On: Second Private Team Sets Launch..."120003,"Ky. Company Wins Grant to Study Peptides (AP)..."submission.csvהקובץ שנוצר להגשה צריך להיות בפורמט csv ולהכיל את הבאים:
id – מזהה המאמרlabel – הקטגוריה החזויהדוגמה:
id,label120001,2120002,3120003,3train.csv.החיזויים יושוו עם התוויות האמיתיות ויחושב הדיוק:
accuracy = (מספר_חיזויים_נכונים / מספר_חיזויים_כולל)הציון הסופי מחושב על בסיס הדיוק שהושג באמצעות הכללים הבאים: