加载中...
题目 #42
作者:Mihai Nan
难度
您的最佳成绩
不适用
现代金融机构每天处理数千份贷款申请。
为了快速准确地决定谁符合条件,银行使用基于风险模型的自动化系统。
这样的系统将由你来构建。你已获得一个真实的信贷申请数据集,
以及它们的审批历史记录。你的目标是开发一个能够评估客户提交的
新申请的模型。
为你提供了两个文件:
loan_status)主要目标:预测一个概率,基于该概率我们可以将每个申请分类为批准或拒绝(0到1之间的概率,其中0表示肯定不批准贷款,1表示肯定批准贷款)。
每条记录代表一个贷款申请,包含人口统计、财务、行为信息
以及所申请信贷类型的详细信息。
主要属性:
customer_id - 唯一标识符age, occupation_status, years_employedannual_income, credit_score, credit_history_yearssavings_assets, current_debtdefaults_on_file, delinquencies_last_2yrs, derogatory_marksproduct_type, loan_intent, loan_amount, interest_ratedebt_to_income_ratio, loan_to_income_ratio, payment_to_income_ratioloan_status - 仅在train.csv中,要预测的标签最终目标是为test.csv中的行预测loan_status。
前三个子任务验证对数据集结构的理解。
最后一个子任务评估分类模型。
根据年龄对测试集中的每个申请人进行分类:
Young 如果 age < 30Adult 如果 30 ≤ age < 60Senior 如果 age ≥ 60基于debt_to_income_ratio确定风险等级:
LowRisk 如果 DTI < 20MediumRisk 如果 20 ≤ DTI < 40HighRisk 如果 DTI ≥ 40对于测试中的每一行,计算:
total_obligations = current_debt + derogatory_marks + delinquencies_last_2yrs返回一个整数。
构建一个分类模型,为测试中的每一行预测loan_status([0,1]中的概率p)。
使用**AUC(ROC曲线下面积)**进行评估。
子任务1-3进行精确评估(通过比较)。
submission.csv文件必须包含测试中每一行对应的4行,
对应4个子任务。
结构:
subtaskID datapointID answer其中:
customer_id的值Young / Adult / SeniorLowRisk / MediumRisk / HighRiskloan_status = 1的概率(0-1之间的实数)customer_id = 9071的示例:subtaskID datapointID answer1 9071 Adult2 9071 MediumRisk3 9071 124 9071 0.742祝你在开发自动化贷款评估系统方面取得成功!
对于子任务4,使用**ROC AUC(ROC曲线下面积)**进行评估。
这是一个综合衡量分类器在所有可能决策阈值下性能的单一指标。

