Grūtības pakāpe
Jūsu labākais rezultāts
Nav pieejams
Šīs problēmas mērķis ir identificēt krāpnieciskus kredītkaršu darījumus, pamatojoties uz reālu, anonimizētu datu kopu. Problēma atspoguļo reālās pasaules scenāriju, kurā dati ir stipri nelīdzsvaroti un krāpnieciski darījumi ir reti.
Projektā tiek izmantoti divi CSV faili:
train.csv - datu kopa apmācībaitest.csv - datu kopa testēšanai| Kolonna | Apraksts |
|---|---|
| id | Unikāls identifikators katram darījumam |
| Time | Sekunžu skaits, kas pagājis kopš pirmā darījuma |
| V1 - V28 | Anonimizētas pazīmes |
| Amount | Darījuma summa |
| Class | Mērķa mainīgais (0 = leģitīms darījums, 1 = krāpniecība) |
Piezīme: Kolonna Class ir pieejama tikai failā train.csv.
Svarīgs novērojums: Datu kopa ir krasi nelīdzsvarota, tāpēc precizitāte (accuracy) nav atbilstoša metrika klasifikācijas modeļu novērtēšanai.
Nosakiet, cik krāpnieciskiem darījumiem Amount ir lielāks par leģitīmo darījumu vidējo Amount vērtību.
Atbilde ir vesels skaitlis.
Novērtējiet, cik "anomāli" ir krāpnieciskie darījumi, izmantojot Mahalanobisa attālumu (Mahalanobis Distance), kas vienlaikus ņem vērā visus skaitliskos mainīgos (Amount + V1-V28).
Ieteicamie soļi:
Class = 1) no train.csv.Katram darījumam no test.csv prognozējiet krāpniecības pazīmi:
1 = krāpniecība0 = leģitīms darījumsGalvenā metrika: F1-score 1. klasei.
| F1-score | Punkti |
|---|---|
| F1 >= 0.85 | 80 punkti |
| F1 < 0.60 | 0 punkti |
| Vidējais līmenis | Lineāra mērogošana starp 0 un 80 |
Iesniegšanas failam jābūt CSV formātā ar šādām kolonnām:
| Kolonna | Apraksts |
|---|---|
| subtaskID | Apakšuzdevuma numurs (1, 2 vai 3) |
| datapointID | Novērojuma identifikators |
| answer | Atbilde vai prognoze |
Noteikumi:
datapointID = 1 (viena atbilde).test.csv, kur datapointID = vērtība no kolonnas id.Piemērs:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Piezīme: Šīs problēmas risināšanai nav nepieciešams izmantot Transformer tipa arhitektūras.