Svårighetsgrad
Din bästa poäng
Ej tillgänglig
I ett parallellt universum är FairPlay den avdelning som ansvarar för att övervaka lag och spelare under matcher.
Genom åren har FairPlay observerat att vissa matcher tenderar att bli kaotiska oftare när följande inträffar:
För att undvika skandaler så mycket som möjligt ber FairPlay dig att bygga en modell som klassificerar matcher efter deras kaospotential.
Du har tillgång till historiska data om matcher och behöver bygga en klassificeringsmodell som kan förutsäga om matchen kommer att bli kaotisk.
Du har fått tillgång till två filer:
train.csv - historiska matcher, med etiketten chaos_labeltest.csv - nya matcher, utan etikettVarje rad representerar en match och innehåller följande kolumner:
MatchID - unik identifierare för matchenSeason - tävlingssäsongenMatchWeek - omgångenHomeTeam - hemmalagetAwayTeam - bortalagetGoals - totalt antal målShots - totalt antal skottCorners - totalt antal hörnYellowCards - antal gula kortRedCards - antal röda kortTeamStyles - lista över spelstilar associerade med matchen (ex: ["AggressiveTackler", "HighPressure"])chaos_label - endast i train.csv,
Förutsäg om en match från test.csv är kaotisk (binära värden - 0 eller 1).
De första två deluppgifterna verifierar förståelse och förbehandling av data.
Den sista deluppgiften utvärderar prestandan hos klassificeringsmodellen.
Beräkna antalet matcher som spelats av laget "Chelsea", både borta och hemma.
Visa ett enda heltal.
Utgående från kolumnen TeamStyles, beräkna en numerisk poäng kallad StyleAggressionScore, definierad som:
StyleAggressionScore = (antal aggressiva stilar) / (totalt antal stilar)Stilarna som anses aggressiva är:
AggressiveTacklerRiskTakerHighPressureChaosInducerResultatet ska vara ett reellt tal mellan 0 och 1.
Bygg en klassificeringsmodell som förutsäger om en match är kaotisk (chaos_label = 1) eller kontrollerad (chaos_label = 0).
För varje rad i test.csv ska modellen returnera en binär förutsägelse:
Modellen kan använda vilken feature som helst som finns tillgänglig i datasetet, inklusive artificiella features konstruerade inom ramen för tidigare deluppgifter.
För Deluppgift 3 görs utvärderingen med F1 macro-poäng.
F1 macro-poängen beräknas enligt följande:
Denna metrik behandlar båda klasserna lika och straffar modeller som endast förutsäger majoritetsklassen korrekt.
Utvärderingströsklar:
Mellanliggande värden får proportionell poäng.
Filen submission.csv ska innehålla en rad för den första deluppgiften, och 2 rader för varje rad från test, motsvarande de andra 2 deluppgifterna.
Struktur:
subtaskID,datapointID,answerdär:
subtaskID - 1, 2 eller 3datapointID - id-värdet (eller 1 för första deluppgiften)answer - beror på uppgiften:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Källa dataset: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv