Задача #31
Автор:Mihai Nan
Сложность
Ваш лучший результат
Н/Д
Требуется построить модель регрессии, которая будет предсказывать итоговый балл на экзамене (Exam_Score) на основе академических, социальных и личных факторов учащихся.
Модель получает набор характеристик (features) и должна оценить непрерывное числовое значение.
Каждый экземпляр содержит несколько переменных, таких как:
StudyHoursAttendanceParentalInvolvementHealthStatus... (другие столбцы, существующие в датасете)train.csvСодержит все характеристики + целевую метку.
Обязательные столбцы:
SampleIDExam_ScoreПример:
| SampleID | StudyHours | Attendance | ParentalInvolvement | ... | Exam_Score |
|---|---|---|---|---|---|
| 1 | 3.5 | High | Medium | ... | 78 |
| 2 | 1.2 | Low | Low | ... | 55 |
| 3 | 4.0 | High | High | ... | 92 |
test.csvИмеет ту же структуру, что и train.csv, но без столбца Exam_Score, поскольку его нужно предсказать.
Пример:
| SampleID | StudyHours | Attendance | ParentalInvolvement | ... |
|---|---|---|---|---|
| 101 | 3.0 | High | Medium | ... |
| 102 | 0.7 | Low | Low | ... |
Файл submission.csv должен содержать ровно два столбца:
SampleIDExam_Score — предсказание моделиПример:
| SampleID | Exam_Score |
|---|---|
| 101 | 81.2 |
| 102 | 49.7 |
Оценка моделей производится с помощью двух значений:
Затем RMSE преобразуется в балл 0–100 через линейную интерполяцию:
Идеальная модель (RMSE = 0) получает максимальный балл 100.
Датасет сгенерирован на основе публичного набора данных с Kaggle: Student Performance Factors Dataset