Moeilijkheid
Jouw beste score
N.v.t.
In een parallel universum is FairPlay de afdeling die verantwoordelijk is voor het monitoren van teams en spelers tijdens wedstrijden.
Door de jaren heen heeft FairPlay opgemerkt dat bepaalde wedstrijden vaker chaotisch worden wanneer er optreden:
Om schandalen zoveel mogelijk te voorkomen, vraagt FairPlay je om een model te bouwen dat wedstrijden classificeert naar hun potentieel voor chaos.
Je hebt historische gegevens over wedstrijden tot je beschikking en moet een classificatiemodel bouwen dat kan voorspellen of de wedstrijd chaotisch zal worden.
Er zijn twee bestanden voor je beschikbaar gesteld:
train.csv - wedstrijden uit het verleden, met het label chaos_labeltest.csv - nieuwe wedstrijden, zonder labelElke rij vertegenwoordigt een wedstrijd en bevat de volgende kolommen:
MatchID - unieke identificator van de wedstrijdSeason - het competitieseizoenMatchWeek - de speelrondeHomeTeam - het thuisteamAwayTeam - het uitteamGoals - totaal aantal doelpuntenShots - totaal aantal schotenCorners - totaal aantal hoekschoppenYellowCards - aantal gele kaartenRedCards - aantal rode kaartenTeamStyles - lijst van speelstijlen geassocieerd met de wedstrijd (bijv: ["AggressiveTackler", "HighPressure"])chaos_label - alleen in train.csv,
Voorspel of een wedstrijd uit test.csv chaotisch is (binaire waarden - 0 of 1).
De eerste twee subtaken controleren het begrip en de voorverwerking van de gegevens.
De laatste subtaak evalueert de prestatie van het classificatiemodel.
Bereken het aantal wedstrijden gespeeld door het team "Chelsea", zowel uit als thuis.
Toon één enkel geheel getal.
Uitgaande van de kolom TeamStyles, bereken een numerieke score genaamd StyleAggressionScore, gedefinieerd als:
StyleAggressionScore = (aantal agressieve stijlen) / (totaal aantal stijlen)De stijlen die als agressief worden beschouwd zijn:
AggressiveTacklerRiskTakerHighPressureChaosInducerHet resultaat moet een reëel getal zijn tussen 0 en 1.
Bouw een classificatiemodel dat voorspelt of een wedstrijd chaotisch is (chaos_label = 1) of gecontroleerd (chaos_label = 0).
Voor elke rij in test.csv moet het model een binaire voorspelling retourneren:
Het model kan elke beschikbare feature in de dataset gebruiken, inclusief kunstmatige features die zijn geconstrueerd in de vorige subtaken.
Voor Subtaak 3 wordt de evaluatie gedaan met behulp van de F1 macro score.
De F1 macro score wordt als volgt berekend:
Deze metriek behandelt beide klassen gelijk en bestraft modellen die alleen de meerderheidsklasse correct voorspellen.
Evaluatiedrempels:
Tussenliggende waarden krijgen proportionele punten.
Het bestand submission.csv moet één regel bevatten voor de eerste subtaak, en 2 regels voor elke rij uit test, corresponderend met de andere 2 subtaken.
Structuur:
subtaskID,datapointID,answerwaarbij:
subtaskID - 1, 2 of 3datapointID - de id-waarde (of 1 voor de eerste subtaak)answer - afhankelijk van de taak:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Bron dataset: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv