Difficulté
Votre meilleur score
N/D
Dans un univers parallèle, FairPlay est le département responsable de la surveillance des équipes et des joueurs pendant les matchs.
Au fil des années, FairPlay a observé que certains matchs tendent à devenir chaotiques plus souvent lorsqu'apparaissent :
Pour éviter autant que possible les scandales, FairPlay te demande de construire un modèle qui classe les matchs selon leur potentiel de chaos.
Tu as à disposition des données passées sur les matchs et tu dois construire un modèle de classification qui puisse prédire si le match deviendra chaotique.
Deux fichiers ont été mis à ta disposition :
train.csv - matchs passés, avec l'étiquette chaos_labeltest.csv - nouveaux matchs, sans étiquetteChaque ligne représente un match et contient les colonnes suivantes :
MatchID - identifiant unique du matchSeason - la saison compétitiveMatchWeek - la journéeHomeTeam - l'équipe à domicileAwayTeam - l'équipe visiteurGoals - le nombre total de butsShots - le nombre total de tirsCorners - le nombre total de cornersYellowCards - le nombre de cartons jaunesRedCards - le nombre de cartons rougesTeamStyles - liste des styles de jeu associés au match (ex: ["AggressiveTackler", "HighPressure"])chaos_label - uniquement dans train.csv,
Prédire si un match de test.csv est chaotique (valeurs binaires - 0 ou 1).
Les deux premières sous-tâches vérifient la compréhension et le prétraitement des données.
La dernière sous-tâche évalue la performance du modèle de classification.
Calculez le nombre de matchs joués par l'équipe "Chelsea", tant à l'extérieur qu'à domicile.
Affichez un seul nombre entier.
En partant de la colonne TeamStyles, calculez un score numérique appelé StyleAggressionScore, défini comme :
StyleAggressionScore = (nombre de styles agressifs) / (nombre total de styles)Les styles considérés comme agressifs sont :
AggressiveTacklerRiskTakerHighPressureChaosInducerLe résultat doit être un nombre réel entre 0 et 1.
Construisez un modèle de classification qui prédise si un match est chaotique (chaos_label = 1) ou contrôlé (chaos_label = 0).
Pour chaque ligne de test.csv, le modèle doit retourner une prédiction binaire :
Le modèle peut utiliser n'importe quelle caractéristique disponible dans le jeu de données, y compris des caractéristiques artificielles construites dans le cadre des sous-tâches précédentes.
Pour la Sous-tâche 3, l'évaluation se fait en utilisant le score F1 macro.
Le score F1 macro se calcule ainsi :
Cette métrique traite les deux classes de manière égale et pénalise les modèles qui prédisent correctement seulement la classe majoritaire.
Seuils d'évaluation :
Les valeurs intermédiaires reçoivent un score proportionnel.
Le fichier submission.csv doit contenir une ligne pour la première sous-tâche, et 2 lignes pour chaque ligne de test, correspondant aux 2 autres sous-tâches.
Structure :
subtaskID,datapointID,answeroù :
subtaskID - 1, 2 ou 3datapointID - la valeur id (ou 1 pour la première sous-tâche)answer - dépend de la tâche :
| subtaskID | datapointID | answer |
|---|