Сложность
Ваш лучший результат
Н/Д
В параллельной вселенной FairPlay является департаментом, ответственным за мониторинг команд и игроков во время матчей.
На протяжении лет FairPlay заметил, что определенные матчи склонны становиться хаотичными чаще, когда появляются:
Чтобы избежать скандалов как можно больше, FairPlay просит вас построить модель, которая классифицирует матчи по потенциалу хаоса.
У вас есть данные из прошлого о матчах, и вы должны построить модель классификации, которая сможет предсказать, станет ли матч хаотичным.
Вам предоставлены два файла:
train.csv - матчи из прошлого, с меткой chaos_labeltest.csv - новые матчи, без меткиКаждая строка представляет матч и содержит следующие столбцы:
MatchID - уникальный идентификатор матчаSeason - соревновательный сезонMatchWeek - турHomeTeam - команда хозяевAwayTeam - команда гостейGoals - общее количество головShots - общее количество ударовCorners - общее количество угловыхYellowCards - количество желтых карточекRedCards - количество красных карточекTeamStyles - список стилей игры, связанных с матчем (например: ["AggressiveTackler", "HighPressure"])chaos_label - только в train.csv,
Предсказать, является ли матч из test.csv хаотичным (бинарные значения - 0 или 1).
Первые два подзадания проверяют понимание и предобработку данных.
Последнее подзадание оценивает производительность модели классификации.
Вычислите количество матчей, сыгранных командой "Chelsea", как в гостях, так и дома.
Выведите одно целое число.
Исходя из столбца TeamStyles, вычислите числовой показатель под названием StyleAggressionScore, определенный как:
StyleAggressionScore = (количество агрессивных стилей) / (общее количество стилей)Стили, считающиеся агрессивными:
AggressiveTacklerRiskTakerHighPressureChaosInducerРезультат должен быть вещественным числом между 0 и 1.
Постройте модель классификации, которая предсказывает, является ли матч хаотичным (chaos_label = 1) или контролируемым (chaos_label = 0).
Для каждой строки из test.csv модель должна возвращать бинарное предсказание:
Модель может использовать любые доступные признаки в наборе данных, включая искусственные признаки, построенные в рамках предыдущих подзаданий.
Для Подзадания 3 оценка производится с использованием макро F1-показателя.
Макро F1-показатель вычисляется следующим образом:
Эта метрика одинаково относится к обоим классам и штрафует модели, которые правильно предсказывают только мажоритарный класс.
Пороги оценки:
Промежуточные значения получают пропорциональный балл.
Файл submission.csv должен содержать одну строку для первого подзадания и по 2 строки для каждой строки из test, соответствующие остальным 2 подзаданиям.
Структура:
subtaskID,datapointID,answerгде:
subtaskID - 1, 2 или 3datapointID - значение id (или 1 для первого подзадания)answer - зависит от задачи:
| subtaskID | datapointID | answer |
|---|---|---|
| 1 | 1 | 2000 |
| 2 | 25758 | 0 |
| 3 | 25758 | 0 |
Источник датасета: https://www.kaggle.com/datasets/ajaxianazarenka/premier-league?select=PremierLeague.csv