Dificuldade
A tua melhor pontuação
N/D
Em meio às incertezas relacionadas à inflação, uma instituição bancária está realizando uma campanha de marketing por telefone para convencer os clientes a abrirem depósitos a prazo. Após um longo programa de promoção, a empresa deseja avaliar a eficácia da campanha. O conjunto de dados contém informações sobre os clientes, características demográficas e detalhes sobre as chamadas realizadas durante a campanha de marketing. O objetivo do problema é analisar esses dados e resolver várias subtarefas relacionadas ao comportamento do cliente.
Os participantes recebem três arquivos:
deposit.deposit.| Coluna | Descrição |
|---|---|
id | o id |
age | idade do cliente |
job | ocupação do cliente |
marital | estado civil |
education | nível educacional |
default | se o cliente já entrou em default (inadimplência) |
balance | saldo da conta |
housing | se o cliente possui crédito imobiliário |
loan | se o cliente possui empréstimo pessoal |
contact | tipo de contato |
day | dia da chamada |
month | mês da chamada |
duration | duração da chamada |
campaign | número de chamadas na campanha |
pdays | número de dias desde a última campanha |
previous | número de contatos anteriores |
poutcome | resultado da campanha anterior |
deposit | variável alvo: se o cliente abriu um depósito |
O problema está dividido em quatro subtarefas.
Determine a ocupação (job) com a maior taxa de depósito.
A taxa de depósito representa a proporção de clientes para os quais deposit = 1 em relação ao total de clientes com essa profissão.
Output: a ocupação.
Determine o mês (month) em que o maior número de clientes foi contatado por telefone no conjunto de dados de treinamento.
Output: o nome do mês.
Construa um modelo de classificação binária que preveja a variável deposit.
O modelo deve ser treinado usando o train.csv e deve gerar previsões para o test.csv.
Agrupe os clientes do test.csv em dois clusters com base nas variáveis numéricas e retorne para cada cliente o rótulo do cluster ao qual ele pertence.
A solução deve gerar um arquivo submission.csv com a seguinte estrutura:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Explicações:
datapointID terá o valor 1.datapointID terá o valor do id do test.csv.Subtask 1 — Verificação exata da resposta.
Subtask 2 — Verificação exata da resposta.
Subtask 3 — A classificação é avaliada usando F1 macro:
| F1 macro | Pontuação |
|---|---|
| >= 0.85 | pontuação máxima (55p) |
| < 0.65 | 0 pontos |
| entre valores | pontuação proporcional |
Subtask 4 — O clustering é avaliado usando o Adjusted Rand Index (ARI):
| ARI | Pontuação |
|---|---|
| >= 0.9 | pontuação máxima (20p) |
| < 0.5 | 0 pontos |
| entre valores | pontuação proporcional |