Obtížnost
Vaše nejlepší skóre
N/A
V souvislosti s nejistotou ohledně inflace provádí bankovní instituce telemarketingovou kampaň, aby přesvědčila klienty k otevření termínovaných vkladů. Po dlouhém propagačním programu chce společnost vyhodnotit efektivitu kampaně. Datová sada obsahuje informace o klientech, demografické charakteristiky a podrobnosti o hovorech uskutečněných v rámci marketingové kampaně. Cílem problému je analýza těchto dat a vyřešení několika dílčích úloh souvisejících s chováním klientů.
Účastníci obdrží tři soubory:
deposit.deposit.| Sloupec | Popis |
|---|---|
id | ID |
age | věk klienta |
job | profese klienta |
marital | rodinný stav |
education | úroveň vzdělání |
default | zda měl klient někdy platební neschopnost |
balance | zůstatek na účtu |
housing | zda má klient hypotéku |
loan | zda má klient osobní půjčku |
contact | typ kontaktu |
day | den hovoru |
month | měsíc hovoru |
duration | délka hovoru |
campaign | počet hovorů v kampani |
pdays | počet dní od poslední kampaně |
previous | počet předchozích kontaktů |
poutcome | výsledek předchozí kampaně |
deposit | cílová proměnná: zda si klient otevřel vklad |
Problém je rozdělen do čtyř podúloh.
Určete profesi (job) s nejvyšší mírou vkladů.
Míra vkladů představuje podíl klientů, pro které deposit = 1, z celkového počtu klientů s danou profesí.
Výstup: profese.
Určete měsíc (month), ve kterém byl telefonicky kontaktován největší počet klientů v trénovací datové sadě.
Výstup: název měsíce.
Sestavte model binární klasifikace, který předpovídá proměnnou deposit.
Model musí být natrénován pomocí train.csv a musí generovat předpovědi pro test.csv.
Seskupte klienty z test.csv do dvou clusterů na základě numerických proměnných a pro každého klienta vraťte štítek clusteru, do kterého patří.
Řešení musí vygenerovat soubor submission.csv s následující strukturou:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Vysvětlivky:
datapointID hodnotu 1.datapointID hodnotu id z test.csv.Podúloha 1 — Přesná kontrola odpovědi.
Podúloha 2 — Přesná kontrola odpovědi.
Podúloha 3 — Klasifikace je hodnocena pomocí F1 macro:
| F1 macro | Body |
|---|---|
| >= 0.85 | maximální počet bodů (55b) |
| < 0.65 | 0 bodů |
| mezi hodnotami | proporcionální počet bodů |
Podúloha 4 — Clustering je hodnocen pomocí Adjusted Rand Index (ARI):
| ARI | Body |
|---|---|
| >= 0.9 | maximální počet bodů (20b) |
| < 0.5 | 0 bodů |
| mezi hodnotami | proporcionální počet bodů |