Moeilijkheid
Jouw beste score
N.v.t.
Tegen de achtergrond van onzekerheden over inflatie voert een bankinstelling een telefonische marketingcampagne uit om klanten te overtuigen termijndeposito's te openen. Na een langdurig promotieprogramma wil het bedrijf de effectiviteit van de campagne evalueren. De dataset bevat informatie over klanten, demografische kenmerken en details over de oproepen die tijdens de marketingcampagne zijn gedaan. Het doel van dit probleem is om deze gegevens te analyseren en verschillende subtaken op te lossen die verband houden met klantgedrag.
Deelnemers ontvangen drie bestanden:
deposit.deposit.| Kolom | Beschrijving |
|---|---|
id | het id |
age | leeftijd van de klant |
job | beroep van de klant |
marital | burgerlijke staat |
education | opleidingsniveau |
default | of de klant ooit in gebreke is gebleven (default) |
balance | rekeningsaldo |
housing | of de klant een hypotheek heeft |
loan | of de klant een persoonlijke lening heeft |
contact | type contact |
day | dag van de oproep |
month | maand van de oproep |
duration | duur van de oproep |
campaign | aantal oproepen tijdens de campagne |
pdays | aantal dagen sinds de vorige campagne |
previous | aantal eerdere contacten |
poutcome | resultaat van de vorige campagne |
deposit | doelvariabele: of de klant een deposito heeft geopend |
Het probleem is verdeeld in vier subtaken.
Bepaal het beroep (job) met de hoogste deposit-ratio.
De deposit-ratio is het aandeel klanten waarvoor deposit = 1 ten opzichte van het totaal aantal klanten met dat beroep.
Output: het beroep.
Bepaal de maand (month) waarin het grootste aantal klanten uit de trainingsdataset telefonisch is gecontacteerd.
Output: de naam van de maand.
Bouw een binair classificatiemodel dat de variabele deposit voorspelt.
Het model moet worden getraind met train.csv en moet voorspellingen genereren voor test.csv.
Groepeer de klanten uit test.csv in twee clusters op basis van de numerieke variabelen en geef voor elke klant het label van het cluster waartoe deze behoort.
De oplossing moet een bestand submission.csv genereren met de volgende structuur:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Uitleg:
datapointID de waarde 1.datapointID de waarde van het id uit test.csv.Subtaak 1 — Exacte controle van het antwoord.
Subtaak 2 — Exacte controle van het antwoord.
Subtaak 3 — De classificatie wordt geëvalueerd met de F1 macro score:
| F1 macro | Score |
|---|---|
| >= 0.85 | maximale score (55p) |
| < 0.65 | 0 punten |
| tussenliggende waarden | proportionele score |
Subtaak 4 — De clustering wordt geëvalueerd met de Adjusted Rand Index (ARI):
| ARI | Score |
|---|---|
| >= 0.9 | maximale score (20p) |
| < 0.5 | 0 punten |
| tussenliggende waarden | proportionele score |