Problema #42
Autore:Mihai Nan
Difficoltà
Il tuo miglior punteggio
N/D
Le istituzioni finanziarie moderne elaborano quotidianamente migliaia di richieste di prestito.
Per decidere rapidamente e correttamente chi è idoneo, le banche utilizzano sistemi automatici
basati su modelli di rischio.
Un tale sistema deve essere costruito proprio da te. Hai ricevuto accesso a un set
realistico di dati con domande di credito, insieme alla loro cronologia di approvazione.
Il tuo obiettivo è sviluppare un modello che possa valutare le nuove richieste inviate
dai clienti.
Ti sono stati messi a disposizione due file:
loan_status)Obiettivo principale: predizione di una probabilità sulla base della quale possiamo classificare ogni richiesta come approvata o respinta (una probabilità tra 0 e 1, dove 0 significa che sicuramente non viene concesso il prestito e 1 significa che sicuramente viene concesso il prestito).
Ogni record rappresenta una richiesta di prestito, con informazioni demografiche,
finanziarie, comportamentali e dettagli sul tipo di credito richiesto.
Attributi principali:
customer_id - identificatore unicoage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - solo in train.csv, l'etichetta da predireL'obiettivo finale è predire loan_status per le righe in test.csv.
I primi tre subtask verificano la comprensione della struttura del set di dati.
L'ultimo subtask valuta il modello di classificazione.
Classificate ogni richiedente del set di test in base all'età:
Young se age < 30Adult se 30 ≤ age < 60Senior se age ≥ 60Determinate il livello di rischio basato su debt_to_income_ratio:
LowRisk se DTI < 20MediumRisk se 20 ≤ DTI < 40HighRisk se DTI ≥ 40Per ogni riga del test, calcolate:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsRestituite un numero intero.
Costruite un modello di classificazione che predice loan_status (una probabilità p da [0,1]) per ogni riga del test.
La valutazione si fa usando AUC (Area Under the ROC Curve).
I subtask 1–3 si valutano esattamente (per confronto).
Il file submission.csv deve contenere 4 righe per ogni riga del test,
corrispondenti ai 4 subtask.
Struttura:
subtaskID datapointID answerdove:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (numero reale 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Successo nello sviluppo del sistema automatizzato di valutazione dei prestiti!
Per il Subtask 4, la valutazione si fa usando ROC AUC (Area Under the ROC Curve).
Questa è una misura unica che sintetizza le prestazioni di un classificatore per tutte le soglie di decisione possibili.

