სირთულე
თქვენი საუკეთესო შედეგი
არ არის
ინფლაციასთან დაკავშირებული გაურკვევლობის ფონზე, საბანკო დაწესებულება ატარებს სატელეფონო მარკეტინგულ კამპანიას, რათა დაარწმუნოს კლიენტები ვადიანი დეპოზიტების გახსნაში. ხანგრძლივი სარეკლამო პროგრამის შემდეგ, კომპანიას სურს შეაფასოს კამპანიის ეფექტურობა. მონაცემთა ნაკრები შეიცავს ინფორმაციას კლიენტების შესახებ, დემოგრაფიულ მახასიათებლებს და მარკეტინგული კამპანიის ფარგლებში განხორციელებული ზარების დეტალებს. ამოცანის მიზანია ამ მონაცემების ანალიზი და კლიენტების ქცევასთან დაკავშირებული რამდენიმე ქვეამოცანის გადაჭრა.
მონაწილეები იღებენ სამ ფაილს:
deposit.deposit სვეტის გარეშე.| სვეტი | აღწერა |
|---|---|
id | იდენტიფიკატორი |
age | კლიენტის ასაკი |
job | კლიენტის პროფესია |
marital | ოჯახური მდგომარეობა |
education | განათლების დონე |
default | ჰქონდა თუ არა კლიენტს ოდესმე დეფოლტი |
balance | ანგარიშის ბალანსი |
housing | აქვს თუ არა კლიენტს იპოთეკური სესხი |
loan | აქვს თუ არა კლიენტს პერსონალური სესხი |
contact | კონტაქტის ტიპი |
day | ზარის დღე |
month | ზარის თვე |
duration | ზარის ხანგრძლივობა |
campaign | ზარების რაოდენობა კამპანიის განმავლობაში |
pdays | დღეების რაოდენობა ბოლო კამპანიიდან |
previous | წინა კონტაქტების რაოდენობა |
poutcome | წინა კამპანიის შედეგი |
deposit | სამიზნე ცვლადი: გახსნა თუ არა კლიენტმა დეპოზიტი |
ამოცანა დაყოფილია ოთხ ქვეამოცანად.
დაადგინეთ პროფესია (job) დეპოზიტის ყველაზე მაღალი მაჩვენებლით.
დეპოზიტის მაჩვენებელი წარმოადგენს იმ კლიენტების პროპორციას, რომლებისთვისაც deposit = 1, მოცემული პროფესიის მქონე კლიენტების საერთო რაოდენობიდან.
გამომავალი: პროფესია.
დაადგინეთ თვე (month), რომელშიც განხორციელდა ყველაზე მეტი სატელეფონო კონტაქტი train.csv მონაცემთა ნაკრებიდან.
გამომავალი: თვის სახელი.
ააგეთ ბინარული კლასიფიკაციის მოდელი, რომელიც იწინასწარმეტყველებს deposit ცვლადს.
მოდელი უნდა მომზადდეს train.csv-ის გამოყენებით და უნდა დააგენერიროს პროგნოზები test.csv-სთვის.
დააჯგუფეთ test.csv-ის კლიენტები ორ კლასტერად რიცხვითი ცვლადების საფუძველზე და თითოეული კლიენტისთვის დააბრუნეთ იმ კლასტერის ლეიბლი, რომელსაც ის ეკუთვნის.
გადაწყვეტამ უნდა დააგენერიროს submission.csv ფაილი შემდეგი სტრუქტურით:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...განმარტებები:
datapointID სვეტის მნიშვნელობა იქნება 1.datapointID სვეტის მნიშვნელობა იქნება id test.csv-დან.ქვეამოცანა 1 — პასუხის ზუსტი შემოწმება.
ქვეამოცანა 2 — პასუხის ზუსტი შემოწმება.
ქვეამოცანა 3 — კლასიფიკაცია ფასდება F1 macro მეტრიკით:
| F1 macro | ქულა |
|---|---|
| >= 0.85 | მაქსიმალური ქულა (55ქ) |
| < 0.65 | 0 ქულა |
| მნიშვნელობებს შორის | პროპორციული ქულა |
ქვეამოცანა 4 — კლასტერიზაცია ფასდება Adjusted Rand Index (ARI) მეტრიკით:
| ARI | ქულა |
|---|---|
| >= 0.9 | მაქსიმალური ქულა (20ქ) |
| < 0.5 | 0 ქულა |
| მნიშვნელობებს შორის | პროპორციული ქულა |