Težavnost
Vaš najboljši rezultat
N/A
Cilj te težave je identifikacija goljufivih transakcij s kreditnimi karticami na podlagi realnega, anonimiziranega nabora podatkov. Težava odraža scenarij iz resničnega sveta, kjer so podatki močno neuravnoteženi in so goljufive transakcije redke.
Projekt uporablja dve datoteki CSV:
train.csv - nabor podatkov za učenjetest.csv - nabor podatkov za testiranje| Stolpec | Opis |
|---|---|
| id | Edinstven identifikator za vsako transakcijo |
| Time | Število sekund, pretečenih od prve transakcije |
| V1 - V28 | Anonimizirane značilnosti |
| Amount | Vrednost transakcije |
| Class | Ciljna spremenljivka (0 = legitimna transakcija, 1 = goljufija) |
Opomba: Stolpec Class je na voljo samo v train.csv.
Pomembno opozorilo: Nabor podatkov je močno neuravnotežen, zato natančnost (accuracy) ni ustrezna metrika za vrednotenje klasifikacijskih modelov.
Določite, koliko goljufivih transakcij ima Amount večji od povprečnega Amount legitimnih transakcij.
Odgovor je celo število.
Ocenite, kako "nenormalne" so goljufive transakcije z uporabo Mahalanobisove razdalje, ki upošteva vse numerične spremenljivke hkrati (Amount + V1-V28).
Predlagani koraki:
Class = 1) iz train.csv.Za vsako transakcijo v test.csv napovejte oznako goljufije:
1 = goljufija0 = legitimna transakcijaPrimarna metrika: F1-score za razred 1.
| F1-score | Točke |
|---|---|
| F1 >= 0.85 | 80 točk |
| F1 < 0.60 | 0 točk |
| Vmesne vrednosti | Linearno skaliranje med 0 in 80 |
Datoteka za oddajo mora biti v formatu CSV z naslednjimi stolpci:
| Stolpec | Opis |
|---|---|
| subtaskID | Številka podnaloge (1, 2 ali 3) |
| datapointID | Identifikator opazovanja |
| answer | Odgovor ali napoved |
Pravila:
datapointID = 1 (en sam odgovor).test.csv, kjer je datapointID = vrednost iz stolpca id.Primer:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Opomba: Reševanje te težave ne zahteva uporabe arhitektur tipa Transformer.