Sværhedsgrad
Din bedste score
N/A
I et parallelt univers er FairPlay afdelingen, der er ansvarlig for overvågning af hold og spillere under kampe.
Gennem årene har FairPlay observeret, at visse kampe har tendens til at blive kaotiske oftere, når der opstår:
For at undgå skandaler så meget som muligt, beder FairPlay dig om at bygge en model, der klassificerer kampe efter deres potentiale for kaos.
Du har til rådighed historiske data om kampe og skal bygge en klassifikationsmodel, der kan forudsige, om kampen vil blive kaotisk.
Du har fået stillet to filer til rådighed:
train.csv - kampe fra fortiden, med etiketten chaos_labeltest.csv - nye kampe, uden etiketHver række repræsenterer en kamp og indeholder følgende kolonner:
MatchID - unik identifikator for kampenSeason - konkurrencesæsonenMatchWeek - rundenHomeTeam - hjemmeholdetAwayTeam - udeholdetGoals - det samlede antal målShots - det samlede antal skudCorners - det samlede antal hjørnesparkYellowCards - antallet af gule kortRedCards - antallet af røde kortTeamStyles - liste over spillestile associeret med kampen (fx ["AggressiveTackler", "HighPressure"])chaos_label - kun i train.csv,
Forudsig om en kamp fra test.csv er kaotisk (binære værdier - 0 eller 1).
De første to delopgaver verificerer forståelse og forbehandling af data.
Den sidste delopgave evaluerer klassifikationsmodellens ydeevne.
Beregn antallet af kampe spillet af holdet "Chelsea", både ude og hjemme.
Vis et enkelt heltal.
Udgående fra kolonnen TeamStyles, beregn en numerisk score kaldet StyleAggressionScore, defineret som:
StyleAggressionScore = (antallet af aggressive stile) / (det samlede antal stile)De stile, der betragtes som aggressive, er:
AggressiveTacklerRiskTakerHighPressureChaosInducerResultatet skal være et reelt tal mellem 0 og 1.
Byg en klassifikationsmodel, der forudsiger, om en kamp er kaotisk (chaos_label = 1) eller kontrolleret (chaos_label = 0).
For hver række i test.csv skal modellen returnere en binær forudsigelse:
Modellen kan bruge enhver tilgængelig feature i datasættet, inklusive kunstige features konstrueret i de foregående delopgaver.
For Delopgave 3 foretages evalueringen ved hjælp af F1 macro score.
F1 macro score beregnes således:
Denne metrik behandler begge klasser lige og straffer modeller, der kun forudsiger majoritetsklassen korrekt.
Evalueringstærskler:
Mellemliggende værdier får proportional pointgivning.
Filen submission.csv skal indeholde en linje for den første delopgave og 2 linjer for hver række fra test, svarende til de andre 2 delopgaver.
Struktur:
subtaskID,datapointID,answerhvor:
subtaskID - 1, 2 eller 3datapointID - id-værdien (eller 1 for den første delopgave)answer - afhænger af opgaven:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Kilde til datasæt: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv