Difficulté
Votre meilleur score
N/D
Dans le but de maintenir sa santé, Petronel s'est proposé d'être plus sportif. Dans ce sens, il a commencé à faire régulièrement du vélo, tant pour aller au travail qu'à des fins récréatives. Il utilise une application dédiée pour surveiller les courses qu'il effectue et est intéressé à obtenir des statistiques concernant ses courses et à observer la façon dont il réussit à allier l'utile à l'agréable, en catégorisant les courses selon l'objectif poursuivi.
Après avoir obtenu un ensemble de données qui décrit toutes les courses qu'il a effectuées depuis qu'il a commencé à faire du vélo, Petronel souhaite savoir quelle est la vitesse moyenne à laquelle il circule, en fonction du mois calendaire. De plus, Petronel a commencé à étiqueter les courses, en les divisant en : courses dans lesquelles il s'est déplacé entre la maison et le travail, sans faire de détour ; courses dans lesquelles il s'est déplacé entre la maison et le travail, en faisant aussi un détour à des fins récréatives ; et courses purement récréatives. Parce que l'étiquetage est fastidieux, il a besoin d'un programme qui effectue automatiquement l'étiquetage des courses restantes (et de celles à venir) avec une précision raisonnable.
Le fichier dataset_train.csv présente dans l'en-tête les colonnes suivantes :
Activity ID : ID unique de la courseActivity Date : date et heure de début de la course au fuseau horaire GMT, sous la forme Aug 23, 2025, 4:55:36 PMDistance : distance sur laquelle s'est effectué le déplacement, exprimée en kilomètresElapsed Time : durée totale de la course, y compris le temps de reposMoving Time : durée effective du déplacement à véloStarting Latitude, Starting Longitude : coordonnées géographiques du point de départFinish Latitude, Finish Longitude : coordonnées géographiques du point d'arrêtLabel : étiquette appliquée à la course, avec les significations suivantes :
COMMUTE : course-navette sans détour ;LEISURELY_COMMUTE : course-navette avec détour ;PURE_LEISURE : course purement récréative.Le fichier dataset_eval.csv présente les mêmes champs que le fichier avec les données d'entraînement, à l'exception du champ Label, qui doit être déterminé.
Déterminez la vitesse moyenne de déplacement pour chaque mois de l'année, exprimée en km/h, selon les données disponibles dans l'ensemble de données d'entraînement.
Réalisez l'étiquetage des courses présentes dans le fichier dataset_eval.csv, en partant des étiquettes des enregistrements du fichier dataset_train.csv.
Pour l'exigence 1 : 2,5 points chacune pour la vitesse moyenne calculée correctement pour chacun des 12 mois de l'année calendaire - au total, 30 points.
Pour l'exigence 2 : 0,82 point pour chaque 1% de l'ensemble de données étiquetées correctement, jusqu'au seuil maximum de 70 points. En d'autres termes, ~15% d'étiquetages erronés sont tolérés.
Le fichier de sortie est au format CSV, avec l'en-tête suivant :
subtaskID,Answer1,Answer2Pour l'exigence 1, exactement 12 lignes, une pour chaque mois de l'année, comme suit :
1,<mois>,<vitesse moyenne>Le mois sera exprimé par l'abréviation de trois lettres (Jan, Feb etc.) et la vitesse moyenne sera exprimée comme un nombre réel avec exactement 5 décimales après la virgule, arrondies par défaut.
Pour l'exigence 2, une ligne pour chaque enregistrement présent dans le fichier d'évaluation, comme suit :
2,<id de la course>,<étiquette>L'ID de la course est repris directement du fichier d'évaluation, et l'étiquette a une des valeurs décrites ci-dessus.
Trouvez à ce lien une archive zip dans laquelle se trouvent les fichiers d'entraînement et d'évaluation, mais aussi un exemple de fichier de soumission valide, qui obtient 1 point.