Difficulté
Votre meilleur score
N/D
Dans un contexte d'incertitudes liées à l'inflation, une institution bancaire mène une campagne de marketing téléphonique pour convaincre ses clients d'ouvrir des dépôts à terme. Après un long programme de promotion, l'entreprise souhaite évaluer l'efficacité de la campagne. Le jeu de données contient des informations sur les clients, des caractéristiques démographiques et des détails sur les appels effectués dans le cadre de la campagne de marketing. Le but du problème est d'analyser ces données et de résoudre plusieurs sous-tâches liées au comportement des clients.
Les participants reçoivent trois fichiers :
deposit.deposit.| Colonne | Description |
|---|---|
id | l'identifiant |
age | l'âge du client |
job | la profession du client |
marital | l'état civil |
education | le niveau d'éducation |
default | si le client a déjà été en défaut de paiement |
balance | le solde du compte |
housing | si le client a un prêt immobilier |
loan | si le client a un prêt personnel |
contact | le type de contact |
day | le jour de l'appel |
month | le mois de l'appel |
duration | la durée de l'appel |
campaign | le nombre d'appels durant la campagne |
pdays | le nombre de jours depuis la dernière campagne |
previous | le nombre de contacts antérieurs |
poutcome | le résultat de la campagne précédente |
deposit | la variable cible : si le client a ouvert un dépôt |
Le problème est divisé en quatre sous-tâches.
Déterminez la profession (job) ayant le taux de dépôt le plus élevé.
Le taux de dépôt représente la proportion de clients pour lesquels deposit = 1 par rapport au total des clients ayant cette profession.
Sortie : la profession.
Déterminez le mois (month) au cours duquel le plus grand nombre de clients a été contacté par téléphone dans le jeu de données d'entraînement.
Sortie : le nom du mois.
Construisez un modèle de classification binaire qui prédit la variable deposit.
Le modèle doit être entraîné en utilisant train.csv et doit générer des prédictions pour test.csv.
Regroupez les clients de test.csv en deux clusters sur la base des variables numériques et retournez pour chaque client l'étiquette du cluster auquel il appartient.
La solution doit générer un fichier submission.csv avec la structure suivante :
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Explications :
datapointID aura la valeur 1.datapointID aura la valeur id de test.csv.Sous-tâche 1 — Vérification exacte de la réponse.
Sous-tâche 2 — Vérification exacte de la réponse.
Sous-tâche 3 — La classification est évaluée à l'aide du F1 macro :
| F1 macro | Score |
|---|---|
| >= 0.85 | score maximum (55p) |
| < 0.65 | 0 points |
| entre les valeurs | score proportionnel |
Sous-tâche 4 — Le clustering est évalué à l'aide de l'Adjusted Rand Index (ARI) :
| ARI | Score |
|---|---|
| >= 0.9 | score maximum (20p) |
| < 0.5 | 0 points |
| entre les valeurs | score proportionnel |