רמת קושי
הציון הטוב ביותר שלך
לא זמין
לאורך השנים, תוצאות בחינת הבגרות מספקות תמונה מפורטת על ביצועי בתי הספר התיכוניים ברומניה. על ידי ניתוח נתונים היסטוריים על פני מספר שנים, אנו יכולים לגלות מגמות, התפתחות ביצועים לימודיים ולעיתים, תוצאות החורגות מהדפוס.
בהקשר זה, המטרה של בעיה זו היא לנתח סטטיסטית את ביצועי בתי הספר התיכוניים בבחינת הבגרות, לבנות מודלים חיזויים ולזהות תוצאות לא טיפוסיות באמצעות שיטות של Machine Learning.
כדי לפתור את הדרישות של בעיה זו יש לכם גישה למערך נתונים מובנה בצורת שני קבצי csv: train.csv ו-test.csv. מערך נתונים זה מכיל תוצאות מצטברות של בתי ספר תיכוניים במבחנים שונים של בחינת הבגרות, לתקופה 2014–2023.
כל שורה במערך הנתונים (בין אם מדובר במערך האימון או זה לבדיקה) מייצגת את התוצאות של בית ספר תיכון, עבור מקצוע, בשנה.
id – מזהה ייחודי של השורהan – שנת הבחינהliceu – שם בית הספר התיכוןjudet – המחוז בו נמצא בית הספר התיכוןmaterie – מקצוע הבגרותmedie – ממוצע הציונים שהשיגו תלמידי בית הספר התיכון במקצוע המתאיםprocent_reusita – אחוז התלמידים שעברו את המבחןnumar_candidati – מספר המועמדיםpreferinta_materie – אחוז התלמידים שבחרו במקצוע המתאיםanomalie - יכול לקבל את הערך 0 אם זה לא נחשב למצב חריג או את הערך 1 אם המצב הוא בלתי רגיל.הערה: עבור כל בית ספר תיכון יש לנו גם סטטיסטיקות כלליות. עבור אלה, בעמודה materie אנו מוצאים את הערך GENERAL.
הקובץ train.csv מכיל את הסטטיסטיקות מהתקופה 2014-2022, והקובץ test.csv מכיל את הנתונים לשנת 2023, אך העמודות medie ו-anomalie אינן זמינות.
זהו איזה היה המקצוע עם ההעדפה הגבוהה ביותר בשנת 2023 בCOLEGIUL NATIONAL "UNIREA" FOCSANI, אם אנו מחריגים את המקצוע LIMBA ROMANA שהיה חובה לכל המועמדים.
זהו באיזו שנה מהתקופה 2014-2022 המקצוע INFORMATICA MI C-C++ היה בעל הפופולריות הגבוהה ביותר בCOLEGIUL NATIONAL "UNIREA" FOCSANI. אנו מחשיבים שהפופולריות נקבעת על ידי האחוז מהעמודה preferinta_materie (ככל שהאחוז הזה גבוה יותר, כך נחשיב שהמקצוע היה פופולרי יותר).
באמצעות המידע הזמין בקובץ train.csv, העריכו את הערך של הממוצע שהושג עבור כל שורה בקובץ test.csv (שנת 2023).
עבור דרישה זו תוכלו להשתמש בכל שיטה של ניתוח סטטיסטי או מידול המבוססת על הנתונים ההיסטוריים, תוך התחשבות ב:
המטרה היא השגת הערכות הקרובות ביותר לערכים האמיתיים.
נתחו את הנתונים ההיסטוריים מהתקופה 2014–2022 והחליטו, עבור כל שורה בקובץ test.csv, אם התוצאה המתאימה לשנת 2023 היא:
בקבלת ההחלטה תוכלו להתחשב ב:
התוצאה הסופית עבור כל שורה צריכה להיות תווית בינארית:
0 - תוצאה רגילה1 - תוצאה לא טיפוסיתלהערכה אוטומטית עליכם להעלות קובץ בפורמט csv עם המבנה הבא:
id – מזהה השורה (המתאים לזה מ-test.csv)
ididsubtaskID – מזהה הדרישה:
1 לזיהוי המקצוע המועדף (דרישה 1)2 לזיהוי השנה המשגשגת למדעי המחשב (דרישה 2)3 להערכת הממוצע (דרישה 3)4 לזיהוי תוצאות לא טיפוסיות (דרישה 4)answer – התשובה המתאימה לדרישה:
subtaskID = 1: שם המקצוע בדיוק כפי שהוא מופיע במערך הנתוניםsubtaskID = 2: השנהsubtaskID = 3: ערך מספרי (הערכת הממוצע)subtaskID = 4: 0 או 1עבור דרישות 1–2 ההערכה נעשית בדיוק (על ידי השוואה).
עבור דרישה 3 ההערכה נעשית באמצעות Mean Absolute Error (MAE).
כללים:
עבור דרישה 4, הציון מוענק על פי הכללים הבאים: