Naloga #31
Avtor:Mihai Nan
Težavnost
Vaš najboljši rezultat
N/A
Želimo zgraditi model regresije, ki bo napovedal končni rezultat na izpitu (Exam_Score) na podlagi akademskih, socialnih in osebnih dejavnikov učencev.
Model prejme nabor značilnosti (features) in mora oceniti neprekinjeno numerično vrednost.
Vsaka instanca vsebuje več spremenljivk, kot so:
StudyHoursAttendanceParentalInvolvementHealthStatus... (drugi stolpci, ki obstajajo v podatkovni množici)train.csvVsebuje vse značilnosti + ciljno oznako.
Obvezni stolpci:
SampleIDExam_ScorePrimer:
| SampleID | StudyHours | Attendance | ParentalInvolvement | ... | Exam_Score |
|---|---|---|---|---|---|
| 1 | 3.5 | High | Medium | ... | 78 |
| 2 | 1.2 | Low | Low | ... | 55 |
| 3 | 4.0 | High | High | ... | 92 |
test.csvIma enako strukturo kot train.csv, vendar brez stolpca Exam_Score, ker ga je treba napovedati.
Primer:
| SampleID | StudyHours | Attendance | ParentalInvolvement | ... |
|---|---|---|---|---|
| 101 | 3.0 | High | Medium | ... |
| 102 | 0.7 | Low | Low | ... |
Datoteka submission.csv mora vsebovati natanko dva stolpca:
SampleIDExam_Score — napoved modelaPrimer:
| SampleID | Exam_Score |
|---|---|
| 101 | 81.2 |
| 102 | 49.7 |
Vrednotenje modelov se izvaja z dvema vrednostma:
Nato se RMSE pretvori v rezultat 0–100 z linearno interpolacijo:
Idealen model (RMSE = 0) dobi maksimalni rezultat 100.
Podatkovna množica je generirana na podlagi javne podatkovne množice s Kaggle: Student Performance Factors Dataset