Задача #42
Автор:Mihai Nan
Сложность
Ваш лучший результат
Н/Д
Современные финансовые учреждения ежедневно обрабатывают тысячи заявок на кредит.
Чтобы быстро и правильно решить, кто имеет право на кредит, банки используют автоматизированные системы
на основе моделей риска.
Именно такую систему предстоит построить вам. Вы получили доступ к реалистичному набору
данных с кредитными заявками вместе с их историей одобрения.
Ваша цель — разработать модель, которая сможет оценивать новые заявки, поданные
клиентами.
В ваше распоряжение предоставлены два файла:
loan_status)Основная цель: предсказание вероятности, на основе которой мы можем классифицировать каждую заявку как одобренную или отклоненную (вероятность между 0 и 1, где 0 означает, что кредит точно не предоставляется, а 1 означает, что кредит точно предоставляется).
Каждая запись представляет заявку на кредит с демографической,
финансовой, поведенческой информацией и деталями о типе запрашиваемого кредита.
Основные атрибуты:
customer_id - уникальный идентификаторage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - только в train.csv, метка для предсказанияКонечная цель — предсказать loan_status для строк из test.csv.
Первые три подзадачи проверяют понимание структуры набора данных.
Последняя подзадача оценивает модель классификации.
Классифицируйте каждого заявителя из тестового набора по возрасту:
Young если age < 30Adult если 30 ≤ age < 60Senior если age ≥ 60Определите уровень риска на основе debt_to_income_ratio:
LowRisk если DTI < 20MediumRisk если 20 ≤ DTI < 40HighRisk если DTI ≥ 40Для каждой строки из теста вычислите:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsВерните целое число.
Постройте модель классификации, которая предсказывает loan_status (вероятность p из [0,1]) для каждой строки из теста.
Оценка производится с использованием AUC (Area Under the ROC Curve).
Подзадачи 1–3 оцениваются точно (путем сравнения).
Файл submission.csv должен содержать по 4 строки для каждой строки из теста,
соответствующие 4 подзадачам.
Структура:
subtaskID datapointID answerгде:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (вещественное число 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Удачи в разработке автоматизированной системы оценки кредитов!
Для Подзадачи 4 оценка производится с использованием ROC AUC (Area Under the ROC Curve).
Это единая мера, которая обобщает производительность классификатора для всех возможных порогов принятия решений.

