Сложность
Ваш лучший результат
Н/Д
Цель этой задачи — выявление мошеннических транзакций по кредитным картам на основе реального анонимного набора данных. Задача отражает реальный сценарий, в котором данные сильно несбалансированы, а мошеннические транзакции встречаются редко.
В проекте используются два CSV-файла:
train.csv — набор данных для обученияtest.csv — набор данных для тестирования| Столбец | Описание |
|---|---|
| id | Уникальный идентификатор каждой транзакции |
| Time | Количество секунд, прошедших с момента первой транзакции |
| V1 - V28 | Анонимизированные признаки |
| Amount | Сумма транзакции |
| Class | Целевая переменная (0 = легитимная транзакция, 1 = мошенничество) |
Примечание: Столбец Class доступен только в train.csv.
Важное замечание: Набор данных сильно несбалансирован, поэтому accuracy не является подходящей метрикой для оценки моделей классификации.
Определите, сколько мошеннических транзакций имеют Amount больше, чем среднее значение Amount легитимных транзакций.
Ответ должен быть целым числом.
Оцените, насколько «аномальными» являются мошеннические транзакции, используя расстояние Махаланобиса, которое учитывает все числовые переменные одновременно (Amount + V1-V28).
Рекомендуемые шаги:
Class = 1) из train.csv.Для каждой транзакции из test.csv предскажите метку мошенничества:
1 = мошенничество0 = легитимная транзакцияОсновная метрика: F1-score по классу 1.
| F1-score | Баллы |
|---|---|
| F1 >= 0.85 | 80 баллов |
| F1 < 0.60 | 0 баллов |
| Промежуточный результат | Линейное масштабирование от 0 до 80 |
Файл для отправки должен быть в формате CSV со следующими столбцами:
| Столбец | Описание |
|---|---|
| subtaskID | Номер подзадачи (1, 2 или 3) |
| datapointID | Идентификатор наблюдения |
| answer | Ответ или предсказание |
Правила:
datapointID = 1 (один ответ).test.csv, где datapointID — значение из столбца id.Пример:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Примечание: Решение этой задачи не требует использования архитектур типа Transformer.