Zadanie #42
Autor:Mihai Nan
Trudność
Twój najlepszy wynik
Nie dotyczy
Nowoczesne instytucje finansowe przetwarzają codziennie tysiące wniosków kredytowych.
Aby szybko i prawidłowo decydować, kto jest uprawniony, banki używają systemów automatycznych
opartych na modelach ryzyka.
Taki system ma zostać zbudowany właśnie przez Ciebie. Otrzymałeś dostęp do realistycznego zestawu
danych z wnioskami kredytowymi, wraz z ich historią zatwierdzenia.
Twoim celem jest opracowanie modelu, który będzie mógł oceniać nowe wnioski przesłane
przez klientów.
Do dyspozycji otrzymałeś dwa pliki:
loan_status)Główny cel: przewidywanie prawdopodobieństwa na podstawie którego możemy sklasyfikować każdy wniosek jako zatwierdzony lub odrzucony (prawdopodobieństwo między 0 a 1, gdzie 0 oznacza, że kredyt na pewno nie zostanie udzielony, a 1 oznacza, że kredyt na pewno zostanie udzielony).
Każdy rekord reprezentuje wniosek kredytowy, z informacjami demograficznymi,
finansowymi, behawioralnymi i szczegółami dotyczącymi rodzaju wnioskowanego kredytu.
Główne atrybuty:
customer_id - unikalny identyfikatorage, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - tylko w train.csv, etykieta do przewidzeniaOstatecznym celem jest przewidzenie loan_status dla wierszy z test.csv.
Pierwsze trzy podzadania sprawdzają zrozumienie struktury zestawu danych.
Ostatnie podzadanie ocenia model klasyfikacji.
Sklasyfikuj każdego wnioskodawcę z zestawu testowego według wieku:
Young jeśli age < 30Adult jeśli 30 ≤ age < 60Senior jeśli age ≥ 60Określ poziom ryzyka na podstawie debt_to_income_ratio:
LowRisk jeśli DTI < 20MediumRisk jeśli 20 ≤ DTI < 40HighRisk jeśli DTI ≥ 40Dla każdego wiersza z testu oblicz:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrsZwróć liczbę całkowitą.
Zbuduj model klasyfikacji, który przewiduje loan_status (prawdopodobieństwo p z [0,1]) dla każdego wiersza z testu.
Ocena odbywa się przy użyciu AUC (Area Under the ROC Curve).
Podzadania 1–3 są oceniane dokładnie (przez porównanie).
Plik submission.csv musi zawierać 4 linie dla każdego wiersza z testu,
odpowiadające 4 podzadaniom.
Struktura:
subtaskID datapointID answergdzie:
customer_idYoung / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1 (liczba rzeczywista 0–1)customer_id = 9071:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742Powodzenia w opracowaniu zautomatyzowanego systemu oceny kredytów!
Dla Podzadania 4, ocena odbywa się przy użyciu ROC AUC (Area Under the ROC Curve).
Jest to unikalna miara, która syntetyzuje wydajność klasyfikatora dla wszystkich możliwych progów decyzyjnych.

