加载中...
难度
您的最佳成绩
不适用
本问题的目标是基于一个真实的匿名数据集识别信用卡欺诈交易。该问题反映了现实世界中的场景,即数据高度不平衡,欺诈交易非常罕见。
项目使用两个 CSV 文件:
train.csv - 训练数据集test.csv - 测试数据集| 列名 | 描述 |
|---|---|
| id | 每笔交易的唯一标识符 |
| Time | 自第一笔交易以来经过的秒数 |
| V1 - V28 | 匿名化特征 |
| Amount | 交易金额 |
| Class | 目标变量(0 = 合法交易,1 = 欺诈) |
注意: Class 列仅在 train.csv 中提供。
重要观察: 数据集严重不平衡,因此准确率(accuracy)不是评估分类模型的相关指标。
确定有多少笔欺诈交易的 Amount 大于合法交易的平均 Amount。
答案是一个整数。
使用马氏距离评估欺诈交易的“异常”程度,该距离同时考虑所有数值变量(Amount + V1-V28)。
建议步骤:
train.csv 中选择所有欺诈交易(Class = 1)。对于 test.csv 中的每笔交易,预测欺诈标签:
1 = 欺诈0 = 合法交易主要指标:类别 1 的 F1-score。
| F1-score | 分数 |
|---|---|
| F1 >= 0.85 | 80 分 |
| F1 < 0.60 | 0 分 |
| 中间值 | 在 0 到 80 之间线性缩放 |
提交文件必须为 CSV 格式,包含以下列:
| 列名 | 描述 |
|---|---|
| subtaskID | 子任务编号(1, 2 或 3) |
| datapointID | 观测值的标识符 |
| answer | 答案或预测值 |
规则:
datapointID = 1(只有一个答案)。test.csv 中的每笔交易提供一个预测,datapointID = id 列中的值。示例:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0注意: 解决此问题不需要使用 Transformer 类型的架构。