Задача #42
Автор:Mihai Nan
Складність
Ваш найкращий результат
Н/Д
Сучасні фінансові установи щодня обробляють тисячі заявок на позики.
Щоб швидко та правильно вирішити, хто є кваліфікованим, банки використовують автоматизовані системи
на основі моделей ризику.
Така система має бути побудована саме тобою. Ти отримав доступ до реалістичного набору
даних з кредитними заявками разом з їх історією схвалення.
Твоя мета - розробити модель, яка зможе оцінювати нові запити, надіслані
клієнтами.
Тобі надано два файли:
loan_status)Основна мета: прогнозування ймовірності, на основі якої ми можемо класифікувати кожен запит як схвалений або відхилений (ймовірність між 0 та 1, де 0 означає, що позика точно не надається, а 1 означає, що позика точно надається).
Кожен запис представляє заявку на позику з демографічною,
фінансовою, поведінковою інформацією та деталями про тип запитуваного кредиту.
Основні атрибути:
customer_id - унікальний ідентифікаторage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - тільки в train.csv, мітка для прогнозуванняКінцева мета - передбачити loan_status для рядків з test.csv.
Перші три підзавдання перевіряють розуміння структури набору даних.
Останнє підзавдання оцінює модель класифікації.
Класифікуйте кожного заявника з тестового набору за віком:
Young якщо age < 30Adult якщо 30 ≤ age < 60Senior якщо age ≥ 60Визначте рівень ризику на основі debt_to_income_ratio:
LowRisk якщо DTI < 20MediumRisk якщо 20 ≤ DTI < 40HighRisk якщо DTI ≥ 40Для кожного рядка з тесту обчисліть:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsПоверніть ціле число.
Побудуйте модель класифікації, яка прогнозує loan_status (ймовірність p з [0,1]) для кожного рядка з тесту.
Оцінювання проводиться за допомогою AUC (Area Under the ROC Curve).
Підзавдання 1–3 оцінюються точно (шляхом порівняння).
Файл submission.csv повинен містити по 4 рядки для кожного рядка з тесту,
що відповідають 4 підзавданням.
Структура:
subtaskID datapointID answerде:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (дійсне число 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Успіхів у розробці автоматизованої системи оцінки позик!
Для Підзавдання 4 оцінювання проводиться за допомогою ROC AUC (Area Under the ROC Curve).
Це унікальна міра, яка узагальнює продуктивність класифікатора для всіх можливих порогів рішення.

