Sværhedsgrad
Din bedste score
N/A
For at vedligeholde sit helbred har Petronel besluttet at være mere sportslig. I den forbindelse er han begyndt at cykle regelmæssigt, både til arbejde og i rekreativt øjemed. Han bruger en dedikeret app til at overvåge de ture, han gennemfører, og er interesseret i at få statistikker om sine ture og observere, hvordan han formår at kombinere det nyttige med det behagelige ved at kategorisere turene efter deres formål.
Efter at have fået et datasæt, der beskriver alle de ture, han har gennemført, siden han begyndte at cykle, ønsker Petronel at finde ud af, hvad den gennemsnitlige hastighed er, han kører med, afhængigt af kalendermåneden. Desuden er Petronel begyndt at mærke turene ved at opdele dem i: ture hvor han har bevæget sig mellem hjem og arbejde uden at tage nogen omvej; ture hvor han har bevæget sig mellem hjem og arbejde, men også har taget en omvej i rekreativt øjemed; og rent rekreative ture. Fordi mærkning er besværligt, har han brug for et program, der automatisk kan mærke de resterende ture (og fremtidige) med rimelig præcision.
Filen dataset_train.csv præsenterer følgende kolonner i headeren:
Activity ID: Turens unikke IDActivity Date: dato og starttidspunkt for turen i GMT-tidszonen i formatet Aug 23, 2025, 4:55:36 PMDistance: den tilbagelagte distance udtrykt i kilometerElapsed Time: turens samlede varighed, inklusive hviletidMoving Time: den faktiske varighed af cyklingStarting Latitude, Starting Longitude: geografiske koordinater for startpunktetFinish Latitude, Finish Longitude: geografiske koordinater for stoppunktetLabel: mærket anvendt på turen med følgende betydninger:
COMMUTE: pendlertur uden omvej;LEISURELY_COMMUTE: pendlertur med omvej;PURE_LEISURE: rent rekreativ tur.Filen dataset_eval.csv præsenterer de samme felter som filen med træningsdata, med undtagelse af feltet Label, som skal bestemmes.
Bestem den gennemsnitlige rejsehastighed for hver måned af året, udtrykt i km/t, i henhold til de tilgængelige data i træningsdatasættet.
Udfør mærkning af turene i filen dataset_eval.csv baseret på mærkaterne fra posterne i filen dataset_train.csv.
For krav 1: 2,5 point for den gennemsnitlige hastighed beregnet korrekt for hver af de 12 måneder i kalenderåret - i alt 30 point.
For krav 2: 0,82 point for hver 1% af datasættet mærket korrekt, op til den maksimale tærskel på 70 point. Med andre ord tolereres ~15% forkerte mærkninger.
Outputfilen er i CSV-format med følgende header:
subtaskID,Answer1,Answer2For krav 1, præcis 12 rækker, én for hver måned af året, som følger:
1,<måned>,<gennemsnitlig hastighed>Måneden vil blive udtrykt ved tre-bogstavs forkortelsen (Jan, Feb osv.) og den gennemsnitlige hastighed vil blive udtrykt som et reelt tal med præcis 5 decimaler efter kommaet, afrundet ved mangel.
For krav 2, én række for hver post i evalueringsfilen, som følger:
2,<tur-id>,<mærkat>Tur-ID'et er taget direkte fra evalueringsfilen, og mærkatet har en af værdierne beskrevet ovenfor.
Find på dette link et zip-arkiv, hvor du finder trænings- og evalueringsfilerne, men også et eksempel på en gyldig indsendelsesfil, som opnår 1 point.