Opgave #27
Forfatter:Mihai Nan
Sværhedsgrad
Din bedste score
N/A
For dette problem skal du implementere en regressionsmodel, der kan forudsige den opnåede eksamenscore (Exam_Score) ved hjælp af et tilgængeligt datasæt. Datasættet er organiseret i en CSV-fil, og modellens ydeevne vil blive evalueret baseret på Mean Absolute Error (MAE).
Datasættet indeholder følgende kolonner:
Beregn gennemsnittet af værdierne i kolonnen Hours_Studied på træningssættet. For hver studerende i testsættet skal du bestemme den absolutte forskel mellem Hours_Studied og det beregnede gennemsnit.
Bestem for hver studerende i testsættet, om denne sover lidt (<7 timer). Resultatet vil være True eller False.
Tæl hvor mange studerende i træningssættet, der har haft en tidligere score (Previous_Scores) større end eller lig med hver studerende i testsættet.
Bestem antallet af studerende i træningssættet med samme motivationsniveau (Motivation_Level) som hver studerende i testsættet.
Byg en regressionsmodel til at forudsige Exam_Score baseret på de givne karakteristika. Modellen skal generalisere på nye data og vil blive evalueret med MAE.
Exam_Scoretrain_data.csv og evalueres på test_data.csvIndsendelsesfile skal være en CSV med præcis tre kolonner:
| Kolonne | Type | Beskrivelse |
|---|---|---|
subtaskID | integer | Repræsenterer subtask-ID'et (fra 1 til 5). |
datapointID | integer/string | Repræsenterer den unikke identifikator for rækken i testsættet (ID). |
answer | float / int / bool | Svaret for det respektive subtask. Værditype afhænger af subtask: • Subtask 1: float • Subtask 2: boolean • Subtask 3: integer • Subtask 4: integer • Subtask 5: float (modelforudsigelser) |
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 101 | 12.5 |
| 2 | 101 | True |
| 3 | 101 | 7 |
| 4 | 101 | 3 |
| 5 | 101 | 85.3 |
Vigtigt: Hver række i CSV'en repræsenterer svaret for et enkelt subtask og et enkelt datapunkt. For hver
datapointIDskal der være en række for hvert subtask.
Indsendelse af et sample_output genererer 6 point.