Problema #42
Autor:Mihai Nan
Dificuldade
A tua melhor pontuação
N/D
Instituições financeiras modernas processam diariamente milhares de solicitações de empréstimo.
Para decidir rapidamente e corretamente quem é elegível, os bancos usam sistemas automatizados
baseados em modelos de risco.
Um sistema desse tipo será construído exatamente por você. Você recebeu acesso a um conjunto
realista de dados com aplicações de crédito, junto com seu histórico de aprovação.
Seu objetivo é desenvolver um modelo que possa avaliar as novas solicitações enviadas
por clientes.
Foram disponibilizados dois arquivos:
loan_status)Objetivo principal: predição de uma probabilidade com base na qual podemos classificar cada solicitação como aprovada ou rejeitada (uma probabilidade entre 0 e 1, onde 0 significa que certamente o empréstimo não é concedido e 1 significa que certamente o empréstimo é concedido).
Cada registro representa uma solicitação de empréstimo, com informações demográficas,
financeiras, comportamentais e detalhes sobre o tipo de crédito solicitado.
Atributos principais:
customer_id - identificador únicoage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - apenas em train.csv, rótulo a ser previstoO objetivo final é prever loan_status para as linhas em test.csv.
As primeiras três subtarefas verificam a compreensão da estrutura do conjunto de dados.
A última subtarefa avalia o modelo de classificação.
Classifique cada solicitante do conjunto de teste de acordo com a idade:
Young se age < 30Adult se 30 ≤ age < 60Senior se age ≥ 60Determine o nível de risco baseado em debt_to_income_ratio:
LowRisk se DTI < 20MediumRisk se 20 ≤ DTI < 40HighRisk se DTI ≥ 40Para cada linha do teste, calcule:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsRetorne um número inteiro.
Construa um modelo de classificação que preveja loan_status (uma probabilidade p de [0,1]) para cada linha do teste.
A avaliação é feita usando AUC (Area Under the ROC Curve).
Subtarefas 1–3 são avaliadas exatamente (por comparação).
O arquivo submission.csv deve conter 4 linhas para cada linha do teste,
correspondentes às 4 subtarefas.
Estrutura:
subtaskID datapointID answeronde:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (número real 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Sucesso no desenvolvimento do sistema automatizado de avaliação de empréstimos!
Para Subtarefa 4, a avaliação é feita usando ROC AUC (Area Under the ROC Curve).
Esta é uma medida única que sintetiza o desempenho de um classificador para todos os limiares possíveis de decisão.

