Difficoltà
Il tuo miglior punteggio
N/D
Per mantenere la salute, Petronel si è proposto di essere più sportivo. A questo scopo, ha iniziato ad andare regolarmente in bicicletta, sia per andare al lavoro che per scopi ricreativi. Utilizza un'applicazione dedicata per monitorare le corse che effettua ed è interessato ad ottenere statistiche riguardo alle sue corse e ad osservare il modo in cui riesce a combinare l'utile al dilettevole, categorizzando le corse in base allo scopo perseguito.
Dopo aver ottenuto un set di dati che descrive tutte le corse che ha effettuato da quando ha iniziato ad andare in bicicletta, Petronel desidera scoprire qual è la velocità media con cui circola, in funzione del mese calendaristico. Inoltre, Petronel ha iniziato ad etichettare le corse, dividendole in: corse in cui si è spostato tra casa e lavoro, senza fare alcuna deviazione; corse in cui si è spostato tra casa e lavoro, facendo anche una deviazione per scopi ricreativi; e corse puramente ricreative. Poiché l'etichettatura è laboriosa, ha bisogno di un programma che effettui automaticamente l'etichettatura delle corse rimanenti (e di quelle future) con una precisione ragionevole.
Il file dataset_train.csv presenta nell'intestazione le seguenti colonne:
Activity ID: ID unico della corsaActivity Date: data e ora di inizio della corsa nel fuso orario GMT, nella forma Aug 23, 2025, 4:55:36 PMDistance: distanza su cui è stato effettuato lo spostamento, espressa in chilometriElapsed Time: durata totale della corsa, incluso il tempo di riposoMoving Time: durata effettiva dello spostamento in biciclettaStarting Latitude, Starting Longitude: coordinate geografiche del punto di partenzaFinish Latitude, Finish Longitude: coordinate geografiche del punto di arrivoLabel: etichetta applicata alla corsa, con i seguenti significati:
COMMUTE: corsa-pendolarismo senza deviazione;LEISURELY_COMMUTE: corsa-pendolarismo con deviazione;PURE_LEISURE: corsa puramente ricreativa.Il file dataset_eval.csv presenta gli stessi campi del file con i dati per l'addestramento, ad eccezione del campo Label, che deve essere determinato.
Determinate la velocità media di spostamento per ogni mese dell'anno, espressa in km/h, secondo i dati disponibili nel set di dati di addestramento.
Realizzate l'etichettatura delle corse presenti nel file dataset_eval.csv, partendo dalle etichette delle registrazioni del file dataset_train.csv.
Per il requisito 1: 2,5 punti per la velocità media calcolata correttamente per ciascuno dei 12 mesi dell'anno calendaristico - in totale, 30 punti.
Per il requisito 2: 0,82 punti per ogni 1% del set di dati etichettato correttamente, fino alla soglia massima di 70 punti. In altre parole, si tollerano ~15% etichettature sbagliate.
Il file di output è in formato CSV, con la seguente intestazione:
subtaskID,Answer1,Answer2Per il requisito 1, esattamente 12 righe, una per ogni mese dell'anno, come segue:
1,<mese>,<velocità media>Il mese sarà espresso tramite l'abbreviazione di tre lettere (Jan, Feb ecc.) e la velocità media sarà espressa come un numero reale con esattamente 5 decimali dopo la virgola, arrotondati per difetto.
Per il requisito 2, una riga per ogni registrazione presente nel file di valutazione, come segue:
2,<id della corsa>,<etichetta>L'ID della corsa è preso direttamente dal file di valutazione, e l'etichetta ha uno dei valori descritti sopra.
Trovate a questo link un archivio zip in cui si trovano i file di addestramento e valutazione, ma anche un esempio di file di sottomissione valido, che ottiene 1 punto.