Difficoltà
Il tuo miglior punteggio
N/D
Sullo sfondo delle incertezze legate all'inflazione, un istituto bancario sta conducendo una campagna di marketing telefonico per convincere i clienti ad aprire depositi a termine. Dopo un lungo programma promozionale, l'azienda desidera valutare l'efficacia della campagna. Il set di dati contiene informazioni sui clienti, caratteristiche demografiche e dettagli sulle chiamate effettuate nell'ambito della campagna di marketing. Lo scopo del problema è analizzare questi dati e risolvere diversi subtask relativi al comportamento dei clienti.
I partecipanti ricevono tre file:
deposit.deposit.| Colonna | Descrizione |
|---|---|
id | l'id |
age | età del cliente |
job | occupazione del cliente |
marital | stato civile |
education | livello di istruzione |
default | se il cliente è mai andato in default |
balance | saldo del conto |
housing | se il cliente ha un mutuo ipotecario |
loan | se il cliente ha un prestito personale |
contact | tipo di contatto |
day | giorno della chiamata |
month | mese della chiamata |
duration | durata della chiamata |
campaign | numero di chiamate durante la campagna |
pdays | numero di giorni dall'ultima campagna |
previous | numero di contatti precedenti |
poutcome | risultato della campagna precedente |
deposit | variabile target: se il cliente ha aperto un deposito |
Il problema è diviso in quattro subtask.
Determinare l'occupazione (job) con il più alto tasso di deposito.
Il tasso di deposito rappresenta la proporzione di clienti per i quali deposit = 1 sul totale dei clienti con quella professione.
Output: l'occupazione.
Determinare il mese (month) in cui è stato contattato telefonicamente il maggior numero di clienti nel set di dati di addestramento.
Output: il nome del mese.
Costruire un modello di classificazione binaria che predica la variabile deposit.
Il modello deve essere addestrato utilizzando train.csv e deve generare previsioni per test.csv.
Raggruppare i clienti in test.csv in due cluster basati sulle variabili numeriche e restituire per ogni cliente l'etichetta del cluster di appartenenza.
La soluzione deve generare un file submission.csv con la seguente struttura:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Spiegazioni:
datapointID avrà il valore 1.datapointID avrà il valore id presente in test.csv.Subtask 1 — Verifica esatta della risposta.
Subtask 2 — Verifica esatta della risposta.
Subtask 3 — La classificazione è valutata utilizzando F1 macro:
| F1 macro | Punteggio |
|---|---|
| >= 0.85 | punteggio massimo (55p) |
| < 0.65 | 0 punti |
| tra i valori | punteggio proporzionale |
Subtask 4 — Il clustering è valutato utilizzando l'Adjusted Rand Index (ARI):
| ARI | Punteggio |
|---|---|
| >= 0.9 | punteggio massimo (20p) |
| < 0.5 | 0 punti |
| tra i valori | punteggio proporzionale |