Vanskelighetsgrad
Din beste poengsum
N/A
I et parallelt univers er FairPlay avdelingen som er ansvarlig for å overvåke lag og spillere under kamper.
Gjennom årene har FairPlay observert at visse kamper har en tendens til å bli kaotiske oftere når det oppstår:
For å unngå skandaler så mye som mulig, ber FairPlay deg om å bygge en modell som klassifiserer kamper etter deres kaospotensial.
Du har tilgang til historiske data om kamper og må bygge en klassifikasjonsmodell som kan forutsi om kampen vil bli kaotisk.
Du har fått tilgang til to filer:
train.csv - historiske kamper, med etiketten chaos_labeltest.csv - nye kamper, uten etikettHver rad representerer en kamp og inneholder følgende kolonner:
MatchID - unik identifikator for kampenSeason - konkurransesesongenMatchWeek - rundenHomeTeam - hjemmelagetAwayTeam - bortelagetGoals - totalt antall målShots - totalt antall skuddCorners - totalt antall hjørnesparkYellowCards - antall gule kortRedCards - antall røde kortTeamStyles - liste over spillestiler assosiert med kampen (f.eks: ["AggressiveTackler", "HighPressure"])chaos_label - kun i train.csv,
Forutsi om en kamp fra test.csv er kaotisk (binære verdier - 0 eller 1).
De to første deloppgavene verifiserer forståelse og forbehandling av data.
Den siste deloppgaven evaluerer ytelsen til klassifikasjonsmodellen.
Beregn antall kamper spilt av laget "Chelsea", både borte og hjemme.
Vis et enkelt heltall.
Basert på kolonnen TeamStyles, beregn en numerisk score kalt StyleAggressionScore, definert som:
StyleAggressionScore = (antall aggressive stiler) / (totalt antall stiler)Stilene som anses som aggressive er:
AggressiveTacklerRiskTakerHighPressureChaosInducerResultatet må være et reelt tall mellom 0 og 1.
Bygg en klassifikasjonsmodell som forutsier om en kamp er kaotisk (chaos_label = 1) eller kontrollert (chaos_label = 0).
For hver rad i test.csv, må modellen returnere en binær prediksjon:
Modellen kan bruke alle tilgjengelige features i datasettet, inkludert kunstige features konstruert i de foregående deloppgavene.
For Deloppgave 3 gjøres evalueringen ved bruk av F1 macro score.
F1 macro score beregnes slik:
Denne metrikken behandler begge klasser likt og straffer modeller som kun predikerer majoritetsklassen korrekt.
Evalueringsterskler:
Mellomverdier får proporsjonalt poeng.
Filen submission.csv må inneholde en linje for den første deloppgaven, og 2 linjer for hver rad fra test, tilsvarende de andre 2 deloppgavene.
Struktur:
subtaskID,datapointID,answerhvor:
subtaskID - 1, 2 eller 3datapointID - id-verdien (eller 1 for den første deloppgaven)answer - avhenger av oppgaven:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Kilde datasett: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv