בעיה #39
מחבר:Mihai Nan
רמת קושי
הציון הטוב ביותר שלך
לא זמין
בספרייה של הממלכה הגדולה, הארכיונאים מתמודדים עם משימה הולכת וקשה:
אלפי כתבי יד, קלפים וכרוניקות עתיקות צריכים להיות מאורגנים, מושווים ומאוינדקסים.
כדי לעזור להם, האבות הקדמונים יצרו מנגנון אגדי: אורקל הדמיון. זהו
מכשיר המסוגל לקבוע, בדיוק יוצא דופן, כמה דומים
שני קטעי טקסט, ומחזיר ציון בין 0 ל-5.
אבל המנגנון התדרדר עם הזמן, והמועצה הגדולה של הארכיונאים החליטה שיש צורך
בגרסה מודרנית, הבנויה באמצעות למידת מכונה.
לשם כך, הועמדו לרשותך שני קבצים:
train.csv - הקלפים שהוערו ידנית על ידי הסופריםtest.csv - זוגות חדשים שצריכים להיות מנותחים על ידי הפתרון שלךהמשימה שלך היא לשחזר את האורקל באמצעות סדרה של ניתוחים ומודל חיזוי סופי.
כל שורה בקבצים train.csv ו-test.csv מייצגת זוג משפטים:
המטרה הסופית היא לחזות score עבור כל שורה ב-test.csv.
עבור המשימות המשנה הראשונות, עליכם לנתח את הנתונים שסופקו ב-train.csv ו-test.csv
ולחלץ מידע רלוונטי שונה על המשפטים מהמבחן.
חשבו את האורך של כל משפט (sentence1 ו-sentence2) עבור כל שורה במערך המבחן
ותייגו את הזוג לפי האורך הממוצע:
Short אם הממוצע < 50Medium אם 50 ≤ הממוצע < 100Long אם הממוצע ≥ 100עבור כל שורה בtest, חשבו את מספר המילים בכל משפט (sentence1 ו-sentence2) וקבעו את המספר הכולל לפי הנוסחה:
מספר_כולל = מס_מילים(sentence1) + מס_מילים(sentence2)קבעו את ההפרש המוחלט בין אורך sentence1 לאורך sentence2
עבור כל שורה בtest.
במילים אחרות, עבור כל שורה עליכם לחשב:
|מס_תווים(sentence1) - מס_תווים(sentence2)|בנו מודל למידת מכונה המסוגל לחזות את הערך המספרי score
עבור כל שורה ב-test.csv.
ההערכה הסופית תתבצע באמצעות MAE (Mean Absolute Error), המחושב כך:
המדד למשימת משנה 4 הוא:
עבור משימות משנה 1-3, התשובות מוערכות בדיוק.
קובץ submission.csv צריך להכיל 4 שורות עבור כל שורה במבחן,
המתאימות ל-4 משימות המשנה.
המבנה:
subtaskID datapointID answerמשמעות העמודות:
subtaskID – מספר בין 1 ל-4
datapointID – sampleID מהמבחן
answer – התוצאה:
Short / Medium / LongsampleID = 1714:subtaskID datapointID answer1 1714 Medium2 1714 153 1714 34 1714 3.74הצלחה! המועצה הגדולה של הארכיונאים מטילה את תקוותיה עליכם להחיות את אורקל הדמיון! 🧙♂️