Probleem #42
Auteur:Mihai Nan
Moeilijkheid
Jouw beste score
N.v.t.
Moderne financiële instellingen verwerken dagelijks duizenden leningaanvragen.
Om snel en correct te beslissen wie in aanmerking komt, gebruiken banken geautomatiseerde systemen
gebaseerd op risicomodellen.
Een dergelijk systeem ga je zelf bouwen. Je hebt toegang gekregen tot een
realistische dataset met kredietaanvragen, samen met hun goedkeuringsgeschiedenis.
Je doel is om een model te ontwikkelen dat nieuwe aanvragen van
klanten kan beoordelen.
Er zijn twee bestanden ter beschikking gesteld:
loan_status)Hoofddoel: voorspelling van een waarschijnlijkheid op basis waarvan we elke aanvraag kunnen classificeren als goedgekeurd of afgewezen (een waarschijnlijkheid tussen 0 en 1, waarbij 0 betekent dat de lening zeker niet wordt verstrekt en 1 betekent dat de lening zeker wordt verstrekt).
Elke record vertegenwoordigt een leningaanvraag, met demografische,
financiële, gedragsinformatie en details over het type aangevraagde krediet.
Hoofdattributen:
customer_id - unieke identificatorage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - alleen in train.csv, het te voorspellen labelHet uiteindelijke doel is om loan_status te voorspellen voor de rijen in test.csv.
De eerste drie subtaken controleren het begrip van de datasetstructuur.
De laatste subtaak evalueert het classificatiemodel.
Classificeer elke aanvrager uit de testset op basis van leeftijd:
Young als age < 30Adult als 30 ≤ age < 60Senior als age ≥ 60Bepaal het risiconiveau gebaseerd op debt_to_income_ratio:
LowRisk als DTI < 20MediumRisk als 20 ≤ DTI < 40HighRisk als DTI ≥ 40Voor elke rij in test, bereken:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsRetourneer een geheel getal.
Bouw een classificatiemodel dat loan_status voorspelt (een waarschijnlijkheid p uit [0,1]) voor elke rij in test.
De evaluatie gebeurt met AUC (Area Under the ROC Curve).
Subtaken 1–3 worden exact geëvalueerd (door vergelijking).
Het bestand submission.csv moet 4 regels voor elke rij in test bevatten,
overeenkomend met de 4 subtaken.
Structuur:
subtaskID datapointID answerwaarbij:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (reëel getal 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Succes met het ontwikkelen van het geautomatiseerde leningbeoordelingssysteem!
Voor Subtaak 4 gebeurt de evaluatie met ROC AUC (Area Under the ROC Curve).
Dit is een unieke maat die de prestatie van een classificator samenvat voor alle mogelijke beslissingsdrempels.

