Problema #42
Autor:Mihai Nan
Dificultad
Tu mejor puntuación
N/D
Las instituciones financieras modernas procesan diariamente miles de solicitudes de préstamo.
Para decidir rápida y correctamente quién es elegible, los bancos utilizan sistemas automatizados
basados en modelos de riesgo.
Un sistema de este tipo debe ser construido precisamente por ti. Has recibido acceso a un conjunto
realista de datos con aplicaciones de crédito, junto con su historial de aprobación.
Tu objetivo es desarrollar un modelo que pueda evaluar las nuevas solicitudes enviadas
por clientes.
Se han puesto a tu disposición dos archivos:
loan_status)Objetivo principal: predicción de una probabilidad en base a la cual podemos clasificar cada solicitud como aprobada o rechazada (una probabilidad entre 0 y 1, donde 0 significa que seguramente no se otorga el préstamo y 1 significa que seguramente se otorga el préstamo).
Cada registro representa una solicitud de préstamo, con información demográfica,
financiera, comportamental y detalles sobre el tipo de crédito solicitado.
Atributos principales:
customer_id - identificador únicoage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - solo en train.csv, la etiqueta a predecirEl objetivo final es predecir loan_status para las filas en test.csv.
Las primeras tres subtareas verifican la comprensión de la estructura del conjunto de datos.
La última subtarea evalúa el modelo de clasificación.
Clasifique cada solicitante del conjunto de prueba según la edad:
Young si age < 30Adult si 30 ≤ age < 60Senior si age ≥ 60Determine el nivel de riesgo basado en debt_to_income_ratio:
LowRisk si DTI < 20MediumRisk si 20 ≤ DTI < 40HighRisk si DTI ≥ 40Para cada fila en test, calcule:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsDevuelva un número entero.
Construya un modelo de clasificación que prediga loan_status (una probabilidad p de [0,1]) para cada fila en test.
La evaluación se realiza usando AUC (Area Under the ROC Curve).
Las subtareas 1–3 se evalúan exactamente (por comparación).
El archivo submission.csv debe contener 4 líneas para cada fila en test,
correspondientes a las 4 subtareas.
Estructura:
subtaskID datapointID answerdonde:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (número real 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742¡Éxito en el desarrollo del sistema automatizado de evaluación de préstamos!
Para la Subtarea 4, la evaluación se realiza usando ROC AUC (Area Under the ROC Curve).
Esta es una medida única que sintetiza el rendimiento de un clasificador para todos los umbrales posibles de decisión.

