Oppgave #42
Forfatter:Mihai Nan
Vanskelighetsgrad
Din beste poengsum
N/A
Moderne finansinstitusjoner behandler daglig tusenvis av lånesøknader.
For å bestemme raskt og korrekt hvem som er kvalifisert, bruker banker automatiserte systemer
basert på risikomodeller.
Et slikt system skal bygges av deg. Du har fått tilgang til et
realistisk datasett med kredittsøknader, sammen med deres godkjenningshistorikk.
Målet ditt er å utvikle en modell som kan evaluere nye søknader sendt inn
av kunder.
Du har fått tilgang til to filer:
loan_status)Hovedmål: prediksjon av en sannsynlighet basert på hvilken vi kan klassifisere hver søknad som godkjent eller avvist (en sannsynlighet mellom 0 og 1, hvor 0 betyr at lånet definitivt ikke innvilges og 1 betyr at lånet definitivt innvilges).
Hver post representerer en lånesøknad, med demografisk,
finansiell, atferdsmessig informasjon og detaljer om typen kreditt som søkes.
Hovedattributter:
customer_id - unik identifikatorage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - kun i train.csv, etiketten som skal predikeresDet endelige målet er å predikere loan_status for radene i test.csv.
De første tre deloppgavene verifiserer forståelsen av datasettets struktur.
Den siste deloppgaven evaluerer klassifikasjonsmodellen.
Klassifiser hver søker fra testsettet basert på alder:
Young hvis age < 30Adult hvis 30 ≤ age < 60Senior hvis age ≥ 60Bestem risikonivået basert på debt_to_income_ratio:
LowRisk hvis DTI < 20MediumRisk hvis 20 ≤ DTI < 40HighRisk hvis DTI ≥ 40For hver rad i test, beregn:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsReturner et heltall.
Bygg en klassifikasjonsmodell som predikerer loan_status (en sannsynlighet p fra [0,1]) for hver rad i test.
Evalueringen gjøres ved bruk av AUC (Area Under the ROC Curve).
Deloppgaver 1–3 evalueres nøyaktig (ved sammenligning).
Filen submission.csv må inneholde 4 linjer for hver rad i test,
tilsvarende de 4 deloppgavene.
Struktur:
subtaskID datapointID answerhvor:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (reelt tall 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Lykke til med utviklingen av det automatiserte systemet for evaluering av lån!
For Deloppgave 4 gjøres evalueringen ved bruk av ROC AUC (Area Under the ROC Curve).
Dette er et unikt mål som sammenfatter ytelsen til en klassifikator for alle mulige beslutningsgrenser.

