Dificultad
Tu mejor puntuación
N/D
En un universo paralelo, FairPlay es el departamento responsable de monitorear equipos y jugadores durante los partidos.
A lo largo de los años, FairPlay ha observado que ciertos partidos tienden a volverse caóticos más frecuentemente cuando aparecen:
Para evitar escándalos tanto como sea posible, FairPlay te pide que construyas un modelo que clasifique los partidos según su potencial de caos.
Tienes a disposición datos del pasado sobre partidos y debes construir un modelo de clasificación que pueda predecir si el partido se volverá caótico.
Se han puesto a tu disposición dos archivos:
train.csv - partidos del pasado, con la etiqueta chaos_labeltest.csv - partidos nuevos, sin etiquetaCada fila representa un partido y contiene las siguientes columnas:
MatchID - identificador único del partidoSeason - la temporada competitivaMatchWeek - la jornadaHomeTeam - el equipo localAwayTeam - el equipo visitanteGoals - número total de golesShots - número total de disparosCorners - número total de córnersYellowCards - número de tarjetas amarillasRedCards - número de tarjetas rojasTeamStyles - lista de estilos de juego asociados al partido (ej: ["AggressiveTackler", "HighPressure"])chaos_label - solo en train.csv,
Predecir si un partido de test.csv es caótico (valores binarios - 0 o 1).
Las primeras dos subtareas verifican la comprensión y el preprocesamiento de los datos.
La última subtarea evalúa el rendimiento del modelo de clasificación.
Calcule el número de partidos jugados por el equipo "Chelsea", tanto de visitante como de local.
Muestre un solo número entero.
Partiendo de la columna TeamStyles, calcule una puntuación numérica llamada StyleAggressionScore, definida como:
StyleAggressionScore = (número de estilos agresivos) / (número total de estilos)Los estilos considerados agresivos son:
AggressiveTacklerRiskTakerHighPressureChaosInducerEl resultado debe ser un número real entre 0 y 1.
Construya un modelo de clasificación que prediga si un partido es caótico (chaos_label = 1) o controlado (chaos_label = 0).
Para cada fila en test.csv, el modelo debe devolver una predicción binaria:
El modelo puede usar cualquier característica disponible en el conjunto de datos, incluyendo características artificiales construidas en el marco de las subtareas anteriores.
Para la Subtarea 3, la evaluación se hace usando la puntuación F1 macro.
La puntuación F1 macro se calcula así:
Esta métrica trata ambas clases de manera igual y penaliza los modelos que predicen correctamente solo la clase mayoritaria.
Umbrales de evaluación:
Los valores intermedios reciben puntuación proporcional.
El archivo submission.csv debe contener una línea para la primera subtarea, y 2 líneas para cada fila de test, correspondientes a las otras 2 subtareas.
Estructura:
subtaskID,datapointID,answerdonde:
subtaskID - 1, 2 o 3datapointID - el valor id (o 1 para la primera subtarea)answer - depende de la tarea:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Fuente del dataset: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv