Úloha #31
Autor:Mihai Nan
Obtížnost
Vaše nejlepší skóre
N/A
Cílem je vybudovat model regrese, který bude predikovat finální skóre u zkoušky (Exam_Score) na základě akademických, sociálních a osobních faktorů studentů.
Model dostává sadu charakteristik (features) a musí odhadnout spojitou numerickou hodnotu.
Každá instance obsahuje několik proměnných, například:
StudyHoursAttendanceParentalInvolvementHealthStatus... (další sloupce existující v datasetu)train.csvObsahuje všechny charakteristiky + cílový štítek.
Povinné sloupce:
SampleIDExam_ScorePříklad:
| SampleID | StudyHours | Attendance | ParentalInvolvement | ... | Exam_Score |
|---|---|---|---|---|---|
| 1 | 3.5 | High | Medium | ... | 78 |
| 2 | 1.2 | Low | Low | ... | 55 |
| 3 | 4.0 | High | High | ... | 92 |
test.csvMá stejnou strukturu jako train.csv, ale bez sloupce Exam_Score, protože ten je třeba predikovat.
Příklad:
| SampleID | StudyHours | Attendance | ParentalInvolvement | ... |
|---|---|---|---|---|
| 101 | 3.0 | High | Medium | ... |
| 102 | 0.7 | Low | Low | ... |
Soubor submission.csv musí obsahovat přesně dva sloupce:
SampleIDExam_Score — predikce modeluPříklad:
| SampleID | Exam_Score |
|---|---|
| 101 | 81.2 |
| 102 | 49.7 |
Hodnocení modelů se provádí pomocí dvou hodnot:
Poté je RMSE převedeno na skóre 0–100 pomocí lineární interpolace:
Ideální model (RMSE = 0) získává maximální skóre 100.
Dataset je generován na základě veřejného datasetu z Kaggle: Student Performance Factors Dataset