Težina
Vaš najbolji rezultat
N/D
Cilj ovog problema je identificirati prijevarne transakcije kreditnim karticama na temelju stvarnog, anonimiziranog skupa podataka. Problem odražava scenarij iz stvarnog svijeta, gdje su podaci izrazito neuravnoteženi, a prijevarne transakcije rijetke.
Projekt koristi dvije CSV datoteke:
train.csv - skup podataka za treniranjetest.csv - skup podataka za testiranje| Stupac | Opis |
|---|---|
| id | Jedinstveni identifikator za svaku transakciju |
| Time | Broj sekundi proteklih od prve transakcije |
| V1 - V28 | Anonimizirane značajke |
| Amount | Iznos transakcije |
| Class | Ciljna varijabla (0 = legitimna transakcija, 1 = prijevara) |
Napomena: Stupac Class dostupan je samo u train.csv.
Važna napomena: Skup podataka je ozbiljno neuravnotežen, stoga točnost (accuracy) nije relevantna metrika za evaluaciju klasifikacijskih modela.
Odredite koliko prijevarnih transakcija ima Amount veći od prosječnog Amount legitimnih transakcija.
Odgovor je cijeli broj.
Procijenite koliko su "anormalne" prijevarne transakcije koristeći Mahalanobisovu udaljenost, koja uzima u obzir sve numeričke varijable istovremeno (Amount + V1-V28).
Predloženi koraci:
Class = 1) iz train.csv.Za svaku transakciju u test.csv, predvidite oznaku prijevare:
1 = prijevara0 = legitimna transakcijaGlavna metrika: F1-score na klasi 1.
| F1-score | Bodovi |
|---|---|
| F1 >= 0.85 | 80 bodova |
| F1 < 0.60 | 0 bodova |
| Između | Linearno skaliranje između 0 i 80 |
Datoteka za slanje mora biti u CSV formatu sa sljedećim stupcima:
| Stupac | Opis |
|---|---|
| subtaskID | Broj podzadatka (1, 2 ili 3) |
| datapointID | Identifikator opažanja |
| answer | Odgovor ili predviđanje |
Pravila:
datapointID = 1 (jedan odgovor).test.csv, s datapointID = vrijednost iz stupca id.Primjer:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Napomena: Rješavanje ovog problema ne zahtijeva korištenje arhitektura tipa Transformer.