Vanskelighetsgrad
Din beste poengsum
N/A
Mot et bakteppe av usikkerhet knyttet til inflasjon, gjennomfører en bankinstitusjon en markedsføringskampanje via telefon for å overbevise kunder om å åpne tidsinnskudd. Etter et langt promoteringsprogram ønsker selskapet å evaluere effektiviteten av kampanjen. Datasettet inneholder informasjon om kunder, demografiske kjennetegn og detaljer om samtalene som ble utført i løpet av markedsføringskampanjen. Målet med oppgaven er å analysere disse dataene og løse flere deloppgaver knyttet til kundeadferd.
Deltakerne mottar tre filer:
deposit.deposit.| Kolonne | Beskrivelse |
|---|---|
id | id |
age | kundens alder |
job | kundens yrke |
marital | sivilstand |
education | utdanningsnivå |
default | om kunden noen gang har misligholdt betaling |
balance | kontosaldo |
housing | om kunden har boliglån |
loan | om kunden har personlig lån |
contact | kontaktmetode |
day | dag for samtalen |
month | måned for samtalen |
duration | varighet på samtalen |
campaign | antall samtaler i denne kampanjen |
pdays | antall dager siden forrige kampanje |
previous | antall tidligere kontakter |
poutcome | resultat av forrige kampanje |
deposit | målvariabel: om kunden åpnet et innskudd |
Oppgaven er delt inn i fire deloppgaver.
Finn yrket (job) med den høyeste innskuddsraten.
Innskuddsraten representerer andelen kunder der deposit = 1 av det totale antallet kunder med det yrket.
Output: yrket.
Finn måneden (month) der det høyeste antallet kunder i treningsdatasettet ble kontaktet per telefon.
Output: navnet på måneden.
Bygg en binær klassifiseringsmodell som forutsier variabelen deposit.
Modellen må trenes ved hjelp av train.csv og generere prediksjoner for test.csv.
Grupper kundene i test.csv i to klynger (clusters) basert på numeriske variabler, og returner klyngeetiketten for hver kunde.
Løsningen må generere en fil submission.csv med følgende struktur:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Forklaringer:
datapointID ha verdien 1.datapointID ha verdien til id fra test.csv.Deloppgave 1 — Eksakt sjekk av svaret.
Deloppgave 2 — Eksakt sjekk av svaret.
Deloppgave 3 — Klassifiseringen evalueres ved hjelp av F1 macro:
| F1 macro | Poeng |
|---|---|
| >= 0.85 | maks poengsum (55p) |
| < 0.65 | 0 poeng |
| mellom verdier | proporsjonal poengsum |
Deloppgave 4 — Klyngingen (clustering) evalueres ved hjelp av Adjusted Rand Index (ARI):
| ARI | Poeng |
|---|---|
| >= 0.9 | maks poengsum (20p) |
| < 0.5 | 0 poeng |
| mellom verdier | proporsjonal poengsum |