Сложность
Ваш лучший результат
Н/Д
На фоне неопределенности, связанной с инфляцией, банковское учреждение проводит маркетинговую кампанию по телефону, чтобы убедить клиентов открыть срочные депозиты. После длительной программы продвижения компания хочет оценить эффективность кампании. Набор данных содержит информацию о клиентах, демографические характеристики и подробности о звонках, совершенных в рамках маркетинговой кампании. Цель задачи — проанализировать эти данные и решить несколько подзадач, связанных с поведением клиентов.
Участники получают три файла:
deposit.deposit.| Столбец | Описание |
|---|---|
id | идентификатор |
age | возраст клиента |
job | профессия клиента |
marital | семейное положение |
education | уровень образования |
default | был ли у клиента дефолт когда-либо |
balance | баланс счета |
housing | есть ли у клиента ипотечный кредит |
loan | есть ли у клиента личный кредит |
contact | тип контакта |
day | день звонка |
month | месяц звонка |
duration | длительность звонка |
campaign | количество звонков в рамках кампании |
pdays | количество дней с момента последней кампании |
previous | количество предыдущих контактов |
poutcome | результат предыдущей кампании |
deposit | целевая переменная: открыл ли клиент депозит |
Задача разделена на четыре подзадачи.
Определите профессию (job) с самым высоким уровнем открытия депозитов.
Уровень открытия депозитов представляет собой долю клиентов, для которых deposit = 1, от общего числа клиентов с этой профессией.
Вывод: название профессии.
Определите месяц (month), в котором по телефону было совершено наибольшее количество контактов с клиентами из обучающего набора данных.
Вывод: название месяца.
Постройте модель бинарной классификации, которая предсказывает переменную deposit.
Модель должна быть обучена с использованием train.csv и должна генерировать прогнозы для test.csv.
Сгруппируйте клиентов из test.csv в два кластера на основе числовых переменных и верните для каждого клиента метку кластера, к которому он принадлежит.
Решение должно генерировать файл submission.csv со следующей структурой:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Пояснения:
datapointID будет иметь значение 1.datapointID будет иметь значение id из test.csv.Подзадача 1 — Проверка точного соответствия ответа.
Подзадача 2 — Проверка точного соответствия ответа.
Подзадача 3 — Классификация оценивается с использованием F1 macro:
| F1 macro | Баллы |
|---|---|
| >= 0.85 | максимальный балл (55б) |
| < 0.65 | 0 баллов |
| между значениями | пропорциональный балл |
Подзадача 4 — Кластеризация оценивается с использованием Adjusted Rand Index (ARI):
| ARI | Баллы |
|---|---|
| >= 0.9 | максимальный балл (20б) |
| < 0.5 | 0 баллов |
| между значениями | пропорциональный балл |