רמת קושי
הציון הטוב ביותר שלך
לא זמין
ניתן להשתמש באופן מפורש במודלי שפה מאומנים מראש (למשל: BERT, RoBERTa, sentence-transformers) עם משקולות טעונות. האצת GPU לאימון והסקה מותרת לחלוטין. צינורות עיבוד (Pipelines) קלאסיים של NLP המבוססים על TF-IDF מותרים ומומלצים אף הם.
אי שם בערבות היבשות של ניו מקסיקו, 1883.
לשריף הזקן קלם דאדלי היה הרגל שאף סגן לא הבין מעולם: בכל ערב, לא משנה כמה ארוך היה היום, הוא הניח את כובעו על אוכף הסוס, נשכב על השמיכה והביט היישר למעלה, אל השמיים.
"הכוכבים לא משקרים", נהג לומר. "כל נמלט, כל נווד, כל אדם ישר — כולם מביטים באותם שמיים."
בליל אוגוסט אחד, מותש אחרי שלושה ימים של מרדף אחר כנופיית וגה במדבר, קלם נשכב תחת שמיים שחורים כדיו, זרועים ביותר כוכבים ממה שספר אי פעם. הוא ניסה להירדם כשהכוכבים החלו לנוע — לאט בהתחלה, כמו גחלים הנישאות ברוח ממדורה גוועת. ואז מהר יותר ויותר. הם שרטטו קווים ביניהם. משולשים. ספירלות. חיות. ספרות. צורות שלא ידע את שמן.
"זה בטח החום", מלמל. אבל הוא המשיך להביט.
הצורות הפכו למילים. לא נאמרות — מורגשות. נראה שכל קבוצת כוכבים נושאת משמעות, משקל, סיפור התלוי עליה כמו כרזת "מבוקש" על לוח מודעות של שריף. הוא הושיט יד לעיפרון כדי לרשום אותן, ואז — כלום.
הוא התעורר במקום אחר.
ממלכת הכוכבים. כך הם קראו לה.
זה היה טריטוריה עצומה ושקטה שבה השמיים היו האדמה, וקבוצות הכוכבים היו כפרים — כל אחת קבוצת כוכבים המסודרת בצורה מסוימת, וכל צורה נושאת שם הממתין להתאמה לסיפור שלו. תושבי הממלכה הזו, סופרי הכוכבים, ניהלו רישומים מדוקדקים במשך מאות שנים: יומנים, שירים, יומני מסע, אגדות — כולם נכתבו על ידי אנשים שהביטו באותן צורות כוכבים מלמטה, מהאדמה.
אבל משהו השתבש. סערה שמימית גדולה — המקומיים קראו לה הפיזור — תלשה כל תווית מכל קבוצת כוכבים והשליכה אותן לרוח. כעת אלפי טקסטים צפו ללא קשר מעל צורות הכוכבים שתיארו פעם, וסופרי הכוכבים לא יכלו עוד לומר איזה סיפור שייך לאילו שמיים.
לקלם הוענק תג עשוי מאור כוכבים והוראה פשוטה:
"התאם את המילים בחזרה לכוכבים, שריף. לפני שהסערה הבאה תגיע."
ניתן לך סט של קבוצות כוכבים, כל אחת מתוארת על ידי רצף של נקודות 2D היוצרות צורה גיאומטרית (למשל: צלב, ספירלה, צורה בעלת חמש פינות, ספרות כמו 6, 7, 8, שילובי ספרות וכו'). ניתן לך גם מאגר גדול של קטעי טקסט מועמדים — רישומי יומן, אגדות, תיאורים — כל אחד נכתב במקור על קבוצת כוכבים ספציפית אחת.
המטרה שלך היא לבנות מודל המסוגל לשייך נכון לכל טקסט מהמאגר את קבוצת הכוכבים המתאימה, בהתבסס אך ורק על הקשר הסמנטי והמבני בין גיאומטריית הקואורדינטות לתוכן הטקסט.
train.csv מכיל 300 זוגות של קבוצת כוכבים-טקסט עם תוויות:
| עמודה | תיאור |
|---|---|
id | מזהה קבוצת הכוכבים (0-299) |
coords | וקטור קואורדינטות בן 728 ממדים, מופרד על ידי קווים: \|x1\|x2\|...\|x728\| |
text | הקטע הספרותי המתאים |
test.csv מכיל 50 רצפים של קבוצות כוכבים ללא תוויות (datapointID 1-50):
| עמודה | תיאור |
|---|---|
datapointID | מספר שלם מ-1 עד 50 |
coords | אותו פורמט עם pipe כמו באימון |
כל datapointID מופיע 40-65 פעמים. לא מסופקות תוויות טקסט.
candidates.csv מכיל 500 קטעי טקסט:
| עמודה | תיאור |
|---|---|
text_id | מספר שלם 0-499 |
text | קטע ספרותי (יומן, שיר, אגדה) |
קובץ ההגשה חייב להיות בפורמט CSV עם העמודות הבאות:
| שדה | תיאור |
|---|---|
subtaskID | חייב להיות 1 עבור כל השורות |
datapointID | מספר שלם 1-50, מזהה קבוצת הכוכבים של הבדיקה |
answer | ה-text_id החזוי (מספר שלם 0-499) |
כל אחד מ-50 ה-datapointID-ים של הבדיקה חייב להופיע בדיוק פעם אחת.
דוגמה:
subtaskID,datapointID,answer1,1,421,2,3171,3,467...כל תחזית מוערכת כסיווג single-label מעל 500 מזהי הטקסט המועמדים. התחזית היא או נכונה (1) או שגויה (0).
המדד הסופי הוא מספר התחזיות הנכונות / 50.
הציונים הגולמיים מומרים לנקודות בתחרות באמצעות פונקציה ליניארית עם סף מינימלי:
| Accuracy | ניקוד |
|---|---|
| < 0.30 | 0 נקודות |
| >= 0.85 | 100 נקודות |
| ביניים (0.30 - 0.85) | סילום ליניארי בין 0 ל-100 |
בקיצור: עליך להתאים נכון לפחות 15 מתוך 50 קבוצות כוכבים (accuracy = 0.30) כדי לקבל נקודות כלשהן, והתאמה נכונה של 43 או יותר (accuracy >= 0.85) מזכה בניקוד המקסימלי.
"הכוכבים לא משקרים. אפשר לסמוך על כוכב יותר מאשר על אדם..." — השריף קלם דאדלי, 1883