Moeilijkheid
Jouw beste score
N.v.t.
Met het oog op het onderhouden van zijn gezondheid heeft Petronel zich voorgenomen om sportiever te zijn. In dit opzicht is hij begonnen regelmatig te fietsen, zowel naar het werk als voor recreatieve doeleinden. Hij gebruikt een speciale applicatie om zijn ritten te monitoren en is geïnteresseerd in het verkrijgen van statistieken over zijn ritten en het observeren van de manier waarop hij erin slaagt het nuttige met het aangename te combineren, door ritten te categoriseren op basis van het nagestreefde doel.
Nadat hij een dataset heeft verkregen die alle ritten beschrijft die hij heeft gemaakt sinds hij begon te fietsen, wil Petronel weten wat zijn gemiddelde snelheid is, afhankelijk van de kalendermaand. Daarnaast is Petronel begonnen met het labelen van ritten, waarbij hij ze verdeelt in: ritten waarbij hij zich verplaatste tussen huis en werk, zonder enige omweg te maken; ritten waarbij hij zich verplaatste tussen huis en werk, waarbij hij ook een omweg maakte voor recreatieve doeleinden; en puur recreatieve ritten. Omdat het labelen bewerkelijk is, heeft hij een programma nodig dat automatisch de resterende (en toekomstige) ritten labelt met een redelijke precisie.
Het bestand dataset_train.csv presenteert in de header de volgende kolommen:
Activity ID: unieke ID van de ritActivity Date: datum en tijd van het begin van de rit in GMT-tijdzone, in de vorm Aug 23, 2025, 4:55:36 PMDistance: afstand waarover de verplaatsing plaatsvond, uitgedrukt in kilometersElapsed Time: totale duur van de rit, inclusief rusttijdMoving Time: effectieve duur van de verplaatsing met de fietsStarting Latitude, Starting Longitude: geografische coördinaten van het startpuntFinish Latitude, Finish Longitude: geografische coördinaten van het eindpuntLabel: label toegepast op de rit, met de volgende betekenissen:
COMMUTE: woon-werkrit zonder omweg;LEISURELY_COMMUTE: woon-werkrit met omweg;PURE_LEISURE: puur recreatieve rit.Het bestand dataset_eval.csv presenteert dezelfde velden als het bestand met trainingsgegevens, met uitzondering van het veld Label, dat moet worden bepaald.
Bepaal de gemiddelde verplaatsingssnelheid voor elke maand van het jaar, uitgedrukt in km/u, volgens de beschikbare gegevens in de trainingsgegevensset.
Voer het labelen uit van de ritten aanwezig in het bestand dataset_eval.csv, uitgaande van de labels van de records uit het bestand dataset_train.csv.
Voor vereiste 1: 2,5 punten voor elke correct berekende gemiddelde snelheid voor elk van de 12 maanden van het kalenderjaar - in totaal 30 punten.
Voor vereiste 2: 0,82 punten voor elke 1% van de gegevensset die correct is gelabeld, tot een maximum van 70 punten. Met andere woorden, er wordt ~15% verkeerde labelingen getolereerd.
Het uitvoerbestand is in CSV-formaat, met de volgende header:
subtaskID,Answer1,Answer2Voor vereiste 1, precies 12 rijen, één voor elke maand van het jaar, als volgt:
1,<maand>,<gemiddelde snelheid>De maand wordt uitgedrukt door de afkorting van drie letters (Jan, Feb etc.) en de gemiddelde snelheid wordt uitgedrukt als een reëel getal met precies 5 decimalen na de komma, afgerond naar beneden.
Voor vereiste 2, één rij voor elke record aanwezig in het evaluatiebestand, als volgt:
2,<rit-id>,<label>Het rit-id wordt direct overgenomen uit het evaluatiebestand, en het label heeft een van de hierboven beschreven waarden.
Vind op deze link een zip-archief waarin de trainings- en evaluatiebestanden te vinden zijn, maar ook een voorbeeld van een geldig inzendingsbestand, dat 1 punt behaalt.