Trudność
Twój najlepszy wynik
Nie dotyczy
W obliczu niepewności związanej z inflacją, instytucja bankowa prowadzi kampanię marketingu telefonicznego, aby przekonać klientów do otwierania lokat terminowych. Po długim programie promocyjnym firma chce ocenić skuteczność kampanii. Zestaw danych zawiera informacje o klientach, cechy demograficzne oraz szczegóły dotyczące połączeń wykonanych w ramach kampanii marketingowej. Celem problemu jest analiza tych danych i rozwiązanie kilku podzadań związanych z zachowaniem klientów.
Uczestnicy otrzymują trzy pliki:
deposit.deposit.| Kolumna | Opis |
|---|---|
id | identyfikator |
age | wiek klienta |
job | zawód klienta |
marital | stan cywilny |
education | poziom wykształcenia |
default | czy klient kiedykolwiek zalegał ze spłatą |
balance | saldo konta |
housing | czy klient posiada kredyt hipoteczny |
loan | czy klient posiada kredyt gotówkowy |
contact | typ kontaktu |
day | dzień połączenia |
month | miesiąc połączenia |
duration | czas trwania połączenia |
campaign | liczba połączeń w ramach kampanii |
pdays | liczba dni od ostatniej kampanii |
previous | liczba wcześniejszych kontaktów |
poutcome | wynik poprzedniej kampanii |
deposit | zmienna docelowa: czy klient otworzył lokatę |
Problem jest podzielony na cztery podzadania.
Wyznacz zawód (job) z najwyższym współczynnikiem lokat.
Współczynnik lokat to stosunek liczby klientów, dla których deposit = 1, do całkowitej liczby klientów wykonujących dany zawód.
Output: zawód.
Wyznacz miesiąc (month), w którym skontaktowano się telefonicznie z największą liczbą klientów w zbiorze treningowym.
Output: nazwa miesiąca.
Zbuduj model klasyfikacji binarnej przewidujący zmienną deposit.
Model musi zostać wytrenowany przy użyciu train.csv i musi generować prognozy dla test.csv.
Pogrupuj klientów z test.csv na dwa klastry na podstawie zmiennych numerycznych i zwróć dla każdego klienta etykietę klastra, do którego należy.
Rozwiązanie musi generować plik submission.csv o następującej strukturze:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...Wyjaśnienia:
datapointID będzie miała wartość 1.datapointID będzie miała wartość id z pliku test.csv.Podzadanie 1 — Dokładna weryfikacja odpowiedzi.
Podzadanie 2 — Dokładna weryfikacja odpowiedzi.
Podzadanie 3 — Klasyfikacja jest oceniana przy użyciu F1 macro:
| F1 macro | Punktacja |
|---|---|
| >= 0.85 | maksymalna punktacja (55p) |
| < 0.65 | 0 punktów |
| pomiędzy | punktacja proporcjonalna |
Podzadanie 4 — Klasteryzacja jest oceniana przy użyciu Adjusted Rand Index (ARI):
| ARI | Punktacja |
|---|---|
| >= 0.9 | maksymalna punktacja (20p) |
| < 0.5 | 0 punktów |
| pomiędzy | punktacja proporcjonalna |