Aufgabe #27
Autor:Mihai Nan
Schwierigkeit
Dein bestes Ergebnis
N/V
Für diese Aufgabe müssen Sie ein Regressionsmodell implementieren, das in der Lage ist, das bei einer Prüfung erzielte Ergebnis (Exam_Score) unter Verwendung eines verfügbaren Datensatzes vorherzusagen. Der Datensatz ist in einer CSV-Datei organisiert, und die Leistung des Modells wird auf Basis des Mean Absolute Error (MAE) bewertet.
Der Datensatz enthält folgende Spalten:
Berechnen Sie den Durchschnitt der Werte aus der Spalte Hours_Studied auf dem Trainingssatz. Bestimmen Sie für jeden Studenten im Test den Betrag der Differenz zwischen Hours_Studied und dem berechneten Durchschnitt.
Bestimmen Sie für jeden Studenten im Test, ob dieser wenig schläft (<7 Stunden). Das Ergebnis wird True oder False sein.
Zählen Sie, wie viele Studenten aus dem Trainingssatz ein vorheriges Ergebnis (Previous_Scores) hatten, das größer oder gleich dem jedes Studenten im Test ist.
Bestimmen Sie die Anzahl der Studenten im Training mit demselben Motivationsniveau (Motivation_Level) wie jeder Student im Test.
Erstellen Sie ein Regressionsmodell zur Vorhersage von Exam_Score basierend auf den bereitgestellten Merkmalen. Das Modell muss auf neue Daten generalisieren und wird mit MAE bewertet.
Exam_Scoretrain_data.csv trainiert und auf test_data.csv evaluiert werdenDie Einreichungsdatei muss eine CSV mit genau drei Spalten sein:
| Spalte | Typ | Beschreibung |
|---|---|---|
subtaskID | integer | Repräsentiert die ID der Subtask (von 1 bis 5). |
datapointID | integer/string | Repräsentiert den eindeutigen Bezeichner der Zeile aus dem Testsatz (ID). |
answer | float / int / bool | Die Antwort für die jeweilige Subtask. Der Werttyp hängt von der Subtask ab: • Subtask 1: float • Subtask 2: boolean • Subtask 3: integer • Subtask 4: integer • Subtask 5: float (Modellvorhersagen) |
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 101 | 12.5 |
| 2 | 101 | True |
| 3 | 101 | 7 |
| 4 | 101 | 3 |
| 5 | 101 | 85.3 |
Wichtig: Jede Zeile in der CSV repräsentiert die Antwort für eine einzelne Subtask und einen einzelnen Datenpunkt. Für jede
datapointIDmuss eine Zeile für jede Subtask vorhanden sein.
Das Einreichen eines sample_output generiert 6 Punkte.