Dificuldade
A tua melhor pontuação
N/D
Num universo paralelo, FairPlay é o departamento responsável pelo monitoramento de equipes e jogadores durante as partidas.
Ao longo dos anos, FairPlay observou que certas partidas tendem a se tornar caóticas com mais frequência quando aparecem:
Para evitar escândalos o máximo possível, FairPlay pede que você construa um modelo que classifique as partidas de acordo com o potencial de caos.
Você tem à disposição dados históricos sobre partidas e deve construir um modelo de classificação que possa prever se a partida se tornará caótica.
Foram disponibilizados dois arquivos:
train.csv - partidas do passado, com o rótulo chaos_labeltest.csv - partidas novas, sem rótuloCada linha representa uma partida e contém as seguintes colunas:
MatchID - identificador único da partidaSeason - temporada competitivaMatchWeek - rodadaHomeTeam - equipe mandanteAwayTeam - equipe visitanteGoals - número total de golsShots - número total de chutesCorners - número total de escanteiosYellowCards - número de cartões amarelosRedCards - número de cartões vermelhosTeamStyles - lista de estilos de jogo associados à partida (ex: ["AggressiveTackler", "HighPressure"])chaos_label - apenas em train.csv,
Prever se uma partida do test.csv é caótica (valores binários - 0 ou 1).
As duas primeiras subtarefas verificam a compreensão e o pré-processamento dos dados.
A última subtarefa avalia o desempenho do modelo de classificação.
Calcule o número de partidas jogadas pela equipe "Chelsea", tanto como visitante quanto como mandante.
Exiba um único número inteiro.
A partir da coluna TeamStyles, calcule uma pontuação numérica chamada StyleAggressionScore, definida como:
StyleAggressionScore = (número de estilos agressivos) / (número total de estilos)Os estilos considerados agressivos são:
AggressiveTacklerRiskTakerHighPressureChaosInducerO resultado deve ser um número real entre 0 e 1.
Construa um modelo de classificação que preveja se uma partida é caótica (chaos_label = 1) ou controlada (chaos_label = 0).
Para cada linha do test.csv, o modelo deve retornar uma previsão binária:
O modelo pode usar qualquer feature disponível no conjunto de dados, incluindo features artificiais construídas nas subtarefas anteriores.
Para a Subtarefa 3, a avaliação é feita usando o score F1 macro.
O score F1 macro é calculado da seguinte forma:
Esta métrica trata ambas as classes igualmente e penaliza modelos que preveem corretamente apenas a classe majoritária.
Limiares de avaliação:
Valores intermediários recebem pontuação proporcional.
O arquivo submission.csv deve conter uma linha para a primeira subtarefa, e 2 linhas para cada linha do test, correspondentes às outras 2 subtarefas.
Estrutura:
subtaskID,datapointID,answeronde:
subtaskID - 1, 2 ou 3datapointID - valor do id (ou 1 para a primeira subtarefa)answer - depende da tarefa:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Fonte do dataset: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv