Problème #42
Auteur:Mihai Nan
Difficulté
Votre meilleur score
N/D
Les institutions financières modernes traitent quotidiennement des milliers de demandes de prêt.
Pour décider rapidement et correctement qui est éligible, les banques utilisent des systèmes automatisés
basés sur des modèles de risque.
Un tel système va être construit par vous-même. Vous avez reçu l'accès à un ensemble
réaliste de données avec des demandes de crédit, accompagnées de leur historique d'approbation.
Votre objectif est de développer un modèle qui puisse évaluer les nouvelles demandes soumises
par les clients.
Deux fichiers ont été mis à votre disposition :
loan_status)Objectif principal : prédiction d'une probabilité sur la base de laquelle nous pouvons classer chaque demande comme approuvée ou rejetée (une probabilité entre 0 et 1, où 0 signifie que le prêt n'est certainement pas accordé et 1 signifie que le prêt est certainement accordé).
Chaque enregistrement représente une demande de prêt, avec des informations démographiques,
financières, comportementales et des détails sur le type de crédit demandé.
Attributs principaux :
customer_id - identifiant uniqueage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - uniquement dans train.csv, l'étiquette à prédireL'objectif final est de prédire loan_status pour les lignes de test.csv.
Les trois premières sous-tâches vérifient la compréhension de la structure de l'ensemble de données.
La dernière sous-tâche évalue le modèle de classification.
Classifiez chaque demandeur de l'ensemble de test en fonction de l'âge :
Young si age < 30Adult si 30 ≤ age < 60Senior si age ≥ 60Déterminez le niveau de risque basé sur debt_to_income_ratio :
LowRisk si DTI < 20MediumRisk si 20 ≤ DTI < 40HighRisk si DTI ≥ 40Pour chaque ligne du test, calculez :
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsRetournez un nombre entier.
Construisez un modèle de classification qui prédit loan_status (une probabilité p de [0,1]) pour chaque ligne du test.
L'évaluation se fait en utilisant AUC (Area Under the ROC Curve).
Les sous-tâches 1–3 sont évaluées exactement (par comparaison).
Le fichier submission.csv doit contenir 4 lignes pour chaque ligne du test,
correspondant aux 4 sous-tâches.
Structure :
subtaskID datapointID answeroù :
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (nombre réel 0–1)customer_id = 9071 :subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Succès dans le développement du système automatisé d'évaluation des prêts !
Pour la Sous-tâche 4, l'évaluation se fait en utilisant ROC AUC (Area Under the ROC Curve).
Il s'agit d'une mesure unique qui synthétise la performance d'un classificateur pour tous les seuils de décision possibles.

