Obtížnost
Vaše nejlepší skóre
N/A
Cílem tohoto problému je identifikovat podvodné transakce kreditními kartami na základě reálného, anonymizovaného souboru dat. Problém odráží scénář z reálného světa, kde jsou data silně nevyvážená a podvodné transakce jsou vzácné.
Projekt využívá dva soubory CSV:
train.csv - trénovací sada dattest.csv - testovací sada dat| Sloupec | Popis |
|---|---|
| id | Unikátní identifikátor každé transakce |
| Time | Počet sekund uplynulých od první transakce |
| V1 - V28 | Anonymizované příznaky |
| Amount | Hodnota transakce |
| Class | Cílová proměnná (0 = legitimní transakce, 1 = podvod) |
Poznámka: Sloupec Class je k dispozici pouze v train.csv.
Důležité upozornění: Soubor dat je silně nevyvážený, proto přesnost (accuracy) není relevantní metrikou pro hodnocení klasifikačních modelů.
Určete, kolik podvodných transakcí má Amount vyšší než průměrný Amount legitimních transakcí.
Odpovědí je celé číslo.
Vyhodnoťte, jak „abnormální“ jsou podvodné transakce pomocí Mahalanobisovy vzdálenosti, která bere v úvahu všechny číselné proměnné současně (Amount + V1-V28).
Navrhované kroky:
Class = 1) z train.csv.Pro každou transakci v test.csv předpovězte štítek podvodu:
1 = podvod0 = legitimní transakceHlavní metrika: F1-score pro třídu 1.
| F1-score | Bodové hodnocení |
|---|---|
| F1 >= 0.85 | 80 bodů |
| F1 < 0.60 | 0 bodů |
| Mezihodnota | Lineární škálování mezi 0 a 80 |
Soubor pro odevzdání musí být ve formátu CSV s následujícími sloupci:
| Sloupec | Popis |
|---|---|
| subtaskID | Číslo podúkolu (1, 2 nebo 3) |
| datapointID | Identifikátor pozorování |
| answer | Odpověď nebo predikce |
Pravidla:
datapointID = 1 (jedna odpověď).test.csv, přičemž datapointID = hodnota ze sloupce id.Příklad:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Poznámka: Řešení tohoto problému nevyžaduje použití architektur typu Transformer.