Dificultad
Tu mejor puntuación
N/D
La compañía nacional de ferrocarriles desea predecir el retraso de un tren (en minutos, número entero) en el momento de llegada a la estación final. Para este propósito, se les proporciona un conjunto de datos con detalles sobre los viajes del último año.
Para cada viaje conocemos las siguientes características:
| Nombre | Tipo | Descripción |
|---|---|---|
SampleID | int | Identificador único de la muestra |
departure_time | string (HH:MM) | Hora de salida del tren |
distance_km | float | Distancia total del recorrido |
avg_speed_kmh | float | Velocidad media real de desplazamiento |
num_stops | int | Número de paradas intermedias |
weather | categoría | Condiciones meteorológicas: sunny, rain, snow, fog |
weekday | categoría | Día de la semana |
special_events | 0/1 | Eventos excepcionales en el recorrido |
num_cars | int | Número de vagones |
ticket_price | float | Precio del billete |
comfort_class | categoría | standard, intermediate, premium |
delay_minutes | int | Variable objetivo – retraso del tren en minutos |
La información delay_minutes está disponible solo en el conjunto de entrenamiento (train.csv).
Deben entrenar un modelo capaz de predecir delay_minutes basándose en las demás características.
Deben cargar un archivo csv (submission.csv) con el siguiente formato:
SampleID,delay_minutes0,121,32,15donde:
SampleID debe coincidir con los valores de test.csvdelay_minutes es la predicción de su modelo, redondeada a enteroLa evaluación se realizará usando MAE (Mean Absolute Error):
La puntuación final se calcula basándose en el score MAE obtenido usando las siguientes reglas: