Trudność
Twój najlepszy wynik
Nie dotyczy
W równoległym wszechświecie FairPlay to departament odpowiedzialny za monitorowanie drużyn i zawodników podczas meczów.
Na przestrzeni lat FairPlay zauważył, że niektóre mecze mają tendencję do stawania się chaotycznymi częściej, gdy pojawiają się:
Aby uniknąć skandali w jak największym stopniu, FairPlay prosi cię o zbudowanie modelu, który klasyfikuje mecze według potencjału chaosu.
Masz do dyspozycji dane z przeszłości o meczach i musisz zbudować model klasyfikacyjny, który będzie mógł przewidzieć, czy mecz stanie się chaotyczny.
Zostały ci udostępnione dwa pliki:
train.csv - mecze z przeszłości, z etykietą chaos_labeltest.csv - nowe mecze, bez etykietyKażdy wiersz reprezentuje mecz i zawiera następujące kolumny:
MatchID - unikalny identyfikator meczuSeason - sezon rozgrywekMatchWeek - kolejkaHomeTeam - drużyna gospodarzyAwayTeam - drużyna gościGoals - całkowita liczba goliShots - całkowita liczba strzałówCorners - całkowita liczba rzutów rożnychYellowCards - liczba żółtych kartekRedCards - liczba czerwonych kartekTeamStyles - lista stylów gry związanych z meczem (np. ["AggressiveTackler", "HighPressure"])chaos_label - tylko w train.csv,
Przewidzieć, czy mecz z test.csv jest chaotyczny (wartości binarne - 0 lub 1).
Pierwsze dwa podzadania sprawdzają zrozumienie i przetwarzanie danych.
Ostatnie podzadanie ocenia wydajność modelu klasyfikacyjnego.
Oblicz liczbę meczów rozegranych przez drużynę "Chelsea", zarówno na wyjeździe, jak i w domu.
Wyświetl jedną liczbę całkowitą.
Wychodząc od kolumny TeamStyles, oblicz wynik numeryczny o nazwie StyleAggressionScore, zdefiniowany jako:
StyleAggressionScore = (liczba stylów agresywnych) / (całkowita liczba stylów)Style uważane za agresywne to:
AggressiveTacklerRiskTakerHighPressureChaosInducerWynik musi być liczbą rzeczywistą między 0 a 1.
Zbuduj model klasyfikacyjny, który przewiduje, czy mecz jest chaotyczny (chaos_label = 1) czy kontrolowany (chaos_label = 0).
Dla każdego wiersza z test.csv, model musi zwrócić przewidywanie binarne:
Model może używać dowolnych cech dostępnych w zbiorze danych, włącznie z sztucznymi cechami zbudowanymi w ramach poprzednich podzadań.
Dla Podzadania 3, ocena odbywa się za pomocą wyniku F1 macro.
Wynik F1 macro oblicza się w następujący sposób:
Ta metryka traktuje obie klasy równo i karze modele, które przewidują poprawnie tylko klasę większościową.
Progi oceny:
Wartości pośrednie otrzymują punktację proporcjonalną.
Plik submission.csv musi zawierać jedną linię dla pierwszego podzadania i po 2 linie dla każdego wiersza z test, odpowiadające pozostałym 2 podzadaniom.
Struktura:
subtaskID,datapointID,answergdzie:
subtaskID - 1, 2 lub 3datapointID - wartość id (lub 1 dla pierwszego podzadania)answer - zależy od zadania:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Źródło zbioru danych: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv