Problema #27
Autore:Mihai Nan
Difficoltà
Il tuo miglior punteggio
N/D
Per questo problema dovete implementare un modello di regressione capace di predire il punteggio ottenuto all'esame (Exam_Score) utilizzando un set di dati disponibile. Il set di dati è organizzato in un file CSV, e le prestazioni del modello saranno valutate sulla base del Mean Absolute Error (MAE).
Il set di dati contiene le seguenti colonne:
Calcolate la media dei valori della colonna Hours_Studied sul set di addestramento. Per ogni studente del test, determinate il modulo della differenza tra Hours_Studied e la media calcolata.
Determinate per ogni studente del test se questo dorme poco (<7 ore). Il risultato sarà True o False.
Contate quanti studenti del set di addestramento hanno avuto un punteggio precedente (Previous_Scores) maggiore o uguale a quello di ogni studente del test.
Determinate il numero di studenti dell'addestramento con lo stesso livello di motivazione (Motivation_Level) di ogni studente del test.
Costruite un modello di regressione per predire Exam_Score sulla base delle caratteristiche fornite. Il modello deve generalizzare su dati nuovi e sarà valutato con MAE.
Exam_Scoretrain_data.csv e valutato su test_data.csvIl file di submission deve essere un CSV con esattamente tre colonne:
| Colonna | Tipo | Descrizione |
|---|---|---|
subtaskID | integer | Rappresenta l'ID del subtask (da 1 a 5). |
datapointID | integer/string | Rappresenta l'identificatore unico della riga del set di test (ID). |
answer | float / int / bool | La risposta per il rispettivo subtask. Il tipo del valore dipende dal subtask: • Subtask 1: float • Subtask 2: boolean • Subtask 3: integer • Subtask 4: integer • Subtask 5: float (predizioni modello) |
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 101 | 12.5 |
| 2 | 101 | True |
| 3 | 101 | 7 |
| 4 | 101 | 3 |
| 5 | 101 | 85.3 |
Importante: Ogni riga del CSV rappresenta la risposta per un singolo subtask e un singolo datapoint. Per ogni
datapointIDdeve esistere una riga per ogni subtask.
L'invio di un sample_output genera 6 punti.