加载中...
难度
您的最佳成绩
不适用
在通货膨胀带来的不确定性背景下,一家银行机构正在开展电话营销活动,以说服客户开设定期存款。在经过长期的推广计划后,公司希望评估营销活动的效率。该数据集包含有关客户的信息、人口统计特征以及营销活动期间进行的通话详情。本问题的目的是分析这些数据并解决与客户行为相关的多个子任务。
参与者将收到三个文件:
deposit。deposit 列。| 列名 | 描述 |
|---|---|
id | 唯一标识符 |
age | 客户年龄 |
job | 客户职业 |
marital | 婚姻状况 |
education | 教育程度 |
default | 客户是否曾发生违约 |
balance | 账户余额 |
housing | 客户是否有房贷 |
loan | 客户是否有个人贷款 |
contact | 联系方式类型 |
day | 通话日期(日) |
month | 通话月份 |
duration | 通话时长 |
campaign | 本次营销活动中的通话次数 |
pdays | 距离上次营销活动的天数 |
previous | 之前的联系次数 |
poutcome | 上次营销活动的结果 |
deposit | 目标变量:客户是否开设了存款账户 |
该问题分为四个子任务。
确定存款率 (deposit) 最高的工作岗位 (job)。
存款率是指该职业中 deposit = 1 的客户占该职业总客户数的比例。
输出: 职业名称。
确定训练数据集中电话联系客户数量最多的月份 (month)。
输出: 月份名称。
构建一个二分类模型来预测变量 deposit。
模型必须使用 train.csv 进行训练,并为 test.csv 生成预测结果。
根据数值变量将 test.csv 中的客户分为两个聚类(clusters),并返回每个客户所属的聚类标签。
解决方案必须生成一个具有以下结构的 submission.csv 文件:
subtaskID,datapointID,answer1,1,management2,1,jan3,5686,03,5206,1...4,5686,14,5206,0...说明:
datapointID 列的值应为 1。datapointID 列的值应为 test.csv 中的 id。子任务 1 — 答案精确匹配校验。
子任务 2 — 答案精确匹配校验。
子任务 3 — 分类评估使用 F1 macro 指标:
| F1 macro | 分数 |
|---|---|
| >= 0.85 | 最高分 (55p) |
| < 0.65 | 0 分 |
| 介于两者之间 | 按比例计分 |
子任务 4 — 聚类评估使用 调整兰德指数 (ARI):
| ARI | 分数 |
|---|---|
| >= 0.9 | 最高分 (20p) |
| < 0.5 | 0 分 |
| 介于两者之间 | 按比例计分 |