Difficoltà
Il tuo miglior punteggio
N/D
In un universo parallelo, FairPlay è il dipartimento responsabile del monitoraggio delle squadre e dei giocatori durante le partite.
Nel corso degli anni, FairPlay ha osservato che certe partite tendono a diventare caotiche più spesso quando si verificano:
Per evitare scandali il più possibile, FairPlay ti chiede di costruire un modello che classifichi le partite in base al potenziale di caos.
Hai a disposizione dati storici sulle partite e devi costruire un modello di classificazione che possa predire se la partita diventerà caotica.
Ti sono stati messi a disposizione due file:
train.csv - partite del passato, con l'etichetta chaos_labeltest.csv - partite nuove, senza etichettaOgni riga rappresenta una partita e contiene le seguenti colonne:
MatchID - identificatore unico della partitaSeason - la stagione competitivaMatchWeek - la giornataHomeTeam - la squadra di casaAwayTeam - la squadra ospiteGoals - numero totale di golShots - numero totale di tiriCorners - numero totale di calci d'angoloYellowCards - numero di cartellini gialliRedCards - numero di cartellini rossiTeamStyles - lista di stili di gioco associati alla partita (es: ["AggressiveTackler", "HighPressure"])chaos_label - solo in train.csv,
Predire se una partita in test.csv è caotica (valori binari - 0 o 1).
I primi due subtask verificano la comprensione e il preprocessing dei dati.
L'ultimo subtask valuta le prestazioni del modello di classificazione.
Calcolate il numero di partite giocate dalla squadra "Chelsea", sia in trasferta che in casa.
Visualizzate un singolo numero intero.
Partendo dalla colonna TeamStyles, calcolate un punteggio numerico chiamato StyleAggressionScore, definito come:
StyleAggressionScore = (numero di stili aggressivi) / (numero totale di stili)Gli stili considerati aggressivi sono:
AggressiveTacklerRiskTakerHighPressureChaosInducerIl risultato deve essere un numero reale tra 0 e 1.
Costruite un modello di classificazione che predica se una partita è caotica (chaos_label = 1) o controllata (chaos_label = 0).
Per ogni riga in test.csv, il modello deve restituire una predizione binaria:
Il modello può utilizzare qualsiasi feature disponibile nel dataset, incluse feature artificiali costruite nei subtask precedenti.
Per il Subtask 3, la valutazione viene effettuata utilizzando il punteggio F1 macro.
Il punteggio F1 macro si calcola così:
Questa metrica tratta entrambe le classi in modo uguale e penalizza i modelli che predicono correttamente solo la classe maggioritaria.
Soglie di valutazione:
I valori intermedi ricevono punteggio proporzionale.
Il file submission.csv deve contenere una linea per il primo subtask, e 2 linee per ogni riga del test, corrispondenti agli altri 2 subtask.
Struttura:
subtaskID,datapointID,answerdove:
subtaskID - 1, 2 o 3datapointID - il valore id (o 1 per il primo subtask)answer - dipende dal task:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Fonte dataset: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv