Problème #27
Auteur:Mihai Nan
Difficulté
Votre meilleur score
N/D
Pour ce problème, vous devez implémenter un modèle de régression capable de prédire le score obtenu à l'examen (Exam_Score) en utilisant un jeu de données disponible. Le jeu de données est organisé dans un fichier CSV, et la performance du modèle sera évaluée sur la base de l'Erreur Absolue Moyenne (MAE).
Le jeu de données contient les colonnes suivantes :
Calculez la moyenne des valeurs de la colonne Hours_Studied sur l'ensemble d'entraînement. Pour chaque étudiant du test, déterminez le module de la différence entre Hours_Studied et la moyenne calculée.
Déterminez pour chaque étudiant du test s'il dort peu (<7 heures). Le résultat sera True ou False.
Comptez combien d'étudiants de l'ensemble d'entraînement ont eu un score antérieur (Previous_Scores) supérieur ou égal à celui de chaque étudiant du test.
Déterminez le nombre d'étudiants d'entraînement avec le même niveau de motivation (Motivation_Level) que chaque étudiant du test.
Construisez un modèle de régression pour prédire Exam_Score basé sur les caractéristiques fournies. Le modèle doit généraliser sur de nouvelles données et sera évalué avec MAE.
Exam_Scoretrain_data.csv et évalué sur test_data.csvLe fichier de soumission doit être un CSV avec exactement trois colonnes :
| Colonne | Type | Description |
|---|---|---|
subtaskID | integer | Représente l'ID de la sous-tâche (de 1 à 5). |
datapointID | integer/string | Représente l'identifiant unique de la ligne du jeu de test (ID). |
answer | float / int / bool | La réponse pour la sous-tâche respective. Le type de valeur dépend de la sous-tâche : • Sous-tâche 1 : float • Sous-tâche 2 : boolean • Sous-tâche 3 : integer • Sous-tâche 4 : integer • Sous-tâche 5 : float (prédictions du modèle) |
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 101 | 12.5 |
| 2 | 101 | True |
| 3 | 101 | 7 |
| 4 | 101 | 3 |
| 5 | 101 | 85.3 |
Important : Chaque ligne du CSV représente la réponse pour une seule sous-tâche et un seul datapoint. Pour chaque
datapointID, il doit y avoir une ligne pour chaque sous-tâche.
L'envoi d'un sample_output génère 6 points.