Problème #75
Auteur:OJIA 2025
Difficulté
Votre meilleur score
N/D
La société de transport « SmartCargo România » a besoin de solutions intelligentes pour améliorer les estimations concernant la durée des livraisons. Tu es le nouveau spécialiste en data science de l'équipe, et ta mission est de construire des modèles précis qui prédisent les temps de livraison entre les villes de Roumanie.
Tu dois analyser les données historiques concernant les courses entre villes et comprendre comment des facteurs tels que la distance, l'heure de la journée, le temps, le trafic ou l'expérience du chauffeur influencent la durée effective de la livraison.
Ton objectif est de construire un modèle de Machine Learning capable de prédire le temps estimé pour de nouvelles courses.
Chaque ligne des fichiers train_data.csv et test_data.csv représente une livraison entre deux villes de Roumanie.
Chaque livraison contient les détails suivants :
| Colonne | Description |
|---|---|
ID | Identifiant unique de la course |
City A | La ville de départ (en texte) |
City B | La ville de destination (en texte) |
Distance | La distance réelle entre les villes (en kilomètres) |
Time of Day | Le moment de la journée exprimé en minutes depuis minuit quand une course démarre (0 - 1439) |
Weather | Le temps pendant la course (Clear, Rain, Snow, Fog) |
Traffic | Le niveau de trafic sur une échelle numérique (0.0 - 1000.0), le maximum signifie le plus encombré |
Road Quality | La qualité de la route sur une échelle numérique (1 - 1000), le maximum signifie la meilleure qualité |
Driver Experience | Le niveau d'expérience du chauffeur (1 - 40 ans) |
deliver_time | Seulement dans train_data.csv : le temps réel de livraison en minutes |
Le manager opérationnel t'a donné les deux tâches essentielles suivantes pour améliorer les opérations de « SmartCargo ».
L'ensemble de données pour la prédiction (test_data.csv) contient des échantillons avec les mêmes caractéristiques que l'ensemble d'entraînement, mais sans la colonne predicted_time.
Votre modèle générera des prédictions pour ces échantillons.
Fog) dans l'ensemble de données de prédiction. Trouve et rapporte le nombre de ces courses.Un fichier csv output.csv qui doit inclure les 3 colonnes suivantes :
subtaskID - représente le numéro de la sous-tâche (1, 2)datapointID - qui se réfère à la colonne ID de test_data.csvanswer - la réponse correspondant au point de données pour la sous-tâche respectiveNote : Pour la sous-tâche 1, qui demande une seule réponse pour tout l'ensemble de données, affichez une seule ligne dont le datapointID soit 1.
Soumettez un seul csv qui contient les réponses pour toutes les sous-tâches que vous avez résolues. Pour voir un exemple, téléchargez le fichier sample_output.csv (Note : celui-ci, bien qu'au format correct, obtient 0 point à la soumission).
Les scores pour les sous-tâches seront calculés comme suit :