Dificultad
Tu mejor puntuación
N/D
En un contexto de incertidumbre por la inflación, una institución bancaria está llevando a cabo una campaña de marketing telefónico para convencer a los clientes de abrir depósitos a plazo. Tras un largo programa de promoción, la empresa desea evaluar la eficacia de la campaña. El conjunto de datos contiene información sobre los clientes, características demográficas y detalles sobre las llamadas realizadas durante la campaña de marketing. El objetivo del problema es analizar estos datos y resolver varias subtareas relacionadas con el comportamiento de los clientes.
Los participantes reciben tres archivos:
deposit.deposit.| Columna | Descripción |
|---|---|
id | el id |
age | edad del cliente |
job | ocupación del cliente |
marital | estado civil |
education | nivel educativo |
default | si el cliente ha entrado en mora alguna vez |
balance | saldo de la cuenta |
housing | si el cliente tiene un préstamo hipotecario |
loan | si el cliente tiene un préstamo personal |
contact | tipo de contacto |
day | día de la llamada |
month | mes de la llamada |
duration | duración de la llamada |
campaign | número de llamadas en la campaña |
pdays | número de días desde la última campaña |
previous | número de contactos anteriores |
poutcome | resultado de la campaña anterior |
deposit | variable objetivo: si el cliente abrió un depósito |
El problema se divide en cuatro subtareas.
Determine la ocupación (job) con la mayor tasa de depósitos.
La tasa de depósitos representa la proporción de clientes para los cuales deposit = 1 del total de clientes con esa profesión.
Output: la ocupación.
Determine el mes (month) en el que se contactó telefónicamente al mayor número de clientes en el conjunto de datos de entrenamiento.
Output: el nombre del mes.
Construya un modelo de clasificación binaria que prediga la variable deposit.
El modelo debe entrenarse utilizando train.csv y debe generar predicciones para test.csv.
Agrupe a los clientes de test.csv en dos clústeres basándose en las variables numéricas y devuelva para cada cliente la etiqueta del clúster al que pertenece.
La solución debe generar un archivo submission.csv con la siguiente estructura:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Explicaciones:
datapointID tendrá el valor 1.datapointID tendrá el valor id de test.csv.Subtarea 1 — Verificación exacta de la respuesta.
Subtarea 2 — Verificación exacta de la respuesta.
Subtarea 3 — La clasificación se evalúa utilizando F1 macro:
| F1 macro | Puntuación |
|---|---|
| >= 0.85 | puntuación máxima (55p) |
| < 0.65 | 0 puntos |
| entre valores | puntuación proporcional |
Subtarea 4 — El clustering se evalúa utilizando el Adjusted Rand Index (ARI):
| ARI | Puntuación |
|---|---|
| >= 0.9 | puntuación máxima (20p) |
| < 0.5 | 0 puntos |
| entre valores | puntuación proporcional |