Obtížnost
Vaše nejlepší skóre
N/A
V paralelním vesmíru je FairPlay oddělení odpovědné za monitorování týmů a hráčů během zápasů.
V průběhu let FairPlay pozoroval, že určité zápasy mají tendenci se stávat chaotickými častěji, když se objeví:
Aby se co nejvíce předešlo skandálům, FairPlay tě žádá, abys vytvořil model, který klasifikuje zápasy podle potenciálu chaosu.
Máš k dispozici historická data o zápasech a musíš vytvořit klasifikační model, který dokáže předpovědět, zda se zápas stane chaotickým.
Byly ti poskytnuty dva soubory:
train.csv - historické zápasy s označením chaos_labeltest.csv - nové zápasy bez označeníKaždý řádek představuje zápas a obsahuje následující sloupce:
MatchID - jedinečný identifikátor zápasuSeason - soutěžní sezónaMatchWeek - koloHomeTeam - domácí týmAwayTeam - hostující týmGoals - celkový počet gólůShots - celkový počet střelCorners - celkový počet rohových kopůYellowCards - počet žlutých karetRedCards - počet červených karetTeamStyles - seznam herních stylů spojených se zápasem (např: ["AggressiveTackler", "HighPressure"])chaos_label - pouze v train.csv,
Předpovědět, zda je zápas z test.csv chaotický (binární hodnoty - 0 nebo 1).
První dva podúkoly ověřují porozumění a předzpracování dat.
Poslední podúkol hodnotí výkon klasifikačního modelu.
Vypočítejte počet zápasů odehraných týmem "Chelsea", jak venku, tak doma.
Zobrazte jediné celé číslo.
Vycházeje ze sloupce TeamStyles, vypočítejte numerické skóre nazvané StyleAggressionScore, definované jako:
StyleAggressionScore = (počet agresivních stylů) / (celkový počet stylů)Styly považované za agresivní jsou:
AggressiveTacklerRiskTakerHighPressureChaosInducerVýsledek musí být reálné číslo mezi 0 a 1.
Vytvořte klasifikační model, který předpoví, zda je zápas chaotický (chaos_label = 1) nebo kontrolovaný (chaos_label = 0).
Pro každý řádek v test.csv musí model vrátit binární predikci:
Model může použít jakýkoli dostupný feature v datasetu, včetně umělých features vytvořených v rámci předchozích podúkolů.
Pro Podúkol 3 se hodnocení provádí pomocí F1 macro skóre.
F1 macro skóre se vypočítá takto:
Tato metrika zachází s oběma třídami stejně a penalizuje modely, které správně předpovídají pouze majoritní třídu.
Hodnotící prahy:
Mezilehlé hodnoty dostávají proporcionální bodování.
Soubor submission.csv musí obsahovat jeden řádek pro první podúkol a po 2 řádcích pro každý řádek z test, odpovídající ostatním 2 podúkolům.
Struktura:
subtaskID,datapointID,answerkde:
subtaskID - 1, 2 nebo 3datapointID - hodnota id (nebo 1 pro první podúkol)answer - závisí na úkolu:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Zdroj datasetu: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv