Težavnost
Vaš najboljši rezultat
N/A
V vzporednem vesolju je FairPlay oddelek, odgovoren za spremljanje ekip in igralcev med tekmami.
Skozi leta je FairPlay opazil, da določene tekme pogosteje postanejo kaotične, ko se pojavijo:
Da bi se čim bolj izognili škandalom, te FairPlay prosi, da zgradiš model, ki klasificira tekme glede na potencial za kaos.
Na voljo imaš podatke iz preteklosti o tekmah in moraš zgraditi klasifikacijski model, ki lahko napoveduje, ali bo tekma postala kaotična.
Na voljo sta ti dve datoteki:
train.csv - tekme iz preteklosti z oznako chaos_labeltest.csv - nove tekme brez oznakeVsaka vrstica predstavlja tekmo in vsebuje naslednje stolpce:
MatchID - edinstveni identifikator tekmeSeason - tekmovalna sezonaMatchWeek - krogHomeTeam - domača ekipaAwayTeam - gostujoča ekipaGoals - skupno število golovShots - skupno število strelovCorners - skupno število kotnih udarcevYellowCards - število rumenih kartonovRedCards - število rdečih kartonovTeamStyles - seznam igralnih stilov, povezanih s tekmo (npr: ["AggressiveTackler", "HighPressure"])chaos_label - samo v train.csv,
Napovedati, ali je tekma iz test.csv kaotična (binarne vrednosti - 0 ali 1).
Prvi dve podnalogi preverjata razumevanje in predprocesiranje podatkov.
Zadnja podnaloga ocenjuje uspešnost klasifikacijskega modela.
Izračunajte število tekem, ki jih je odigrala ekipa "Chelsea", tako v gosteh kot doma.
Prikažite eno samo celo število.
Iz stolpca TeamStyles izračunajte numerično oceno z imenom StyleAggressionScore, definirano kot:
StyleAggressionScore = (število agresivnih stilov) / (skupno število stilov)Stili, ki se štejejo za agresivne, so:
AggressiveTacklerRiskTakerHighPressureChaosInducerRezultat mora biti realno število med 0 in 1.
Zgradite klasifikacijski model, ki napoveduje, ali je tekma kaotična (chaos_label = 1) ali nadzorovana (chaos_label = 0).
Za vsako vrstico v test.csv mora model vrniti binarno napoved:
Model lahko uporablja katero koli značilko, ki je na voljo v naboru podatkov, vključno z umetnimi značilkami, zgrajenimi v okviru prejšnjih podnalог.
Za podnalogi 3 se ocenjevanje izvaja z uporabo makro F1 ocene.
Makro F1 ocena se izračuna tako:
Ta metrika obravnava oba razreda enako in kaznuje modele, ki pravilno napovedujejo samo večinski razred.
Pragovi ocenjevanja:
Vmesne vrednosti prejmejo sorazmerno število točk.
Datoteka submission.csv mora vsebovati eno vrstico za prvo podnalogi in po 2 vrstici za vsako vrstico iz test, ki ustrezata ostalima 2 podnalогama.
Struktura:
subtaskID,datapointID,answerkjer:
subtaskID - 1, 2 ali 3datapointID - vrednost id (ali 1 za prvo podnalogi)answer - odvisno od naloge:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Vir nabora podatkov: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv