Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Syftet med detta problem är att identifiera bedrägliga kreditkortstransaktioner baserat på en anonymiserad, verklig datamängd. Problemet återspeglar ett verkligt scenario där data är kraftigt obalanserad och bedrägliga transaktioner är sällsynta.
Projektet använder två CSV-filer:
train.csv - datamängd för träningtest.csv - datamängd för testning| Kolumn | Beskrivning |
|---|---|
| id | Unik identifierare för varje transaktion |
| Time | Antal sekunder som förflutit sedan den första transaktionen |
| V1 - V28 | Anonymiserade egenskaper |
| Amount | Transaktionsbelopp |
| Class | Målvariabel (0 = legitim transaktion, 1 = bedrägeri) |
Notera: Kolumnen Class är endast tillgänglig i train.csv.
Viktig observation: Datamängden är kraftigt obalanserad, så accuracy är inte ett relevant mått för att utvärdera klassificeringsmodeller.
Bestäm hur många bedrägliga transaktioner som har ett Amount som är större än genomsnittligt Amount för legitima transaktioner.
Svaret är ett heltal.
Utvärdera hur "onormala" de bedrägliga transaktionerna är genom att använda Mahalanobis-avstånd, som tar hänsyn till alla numeriska variabler samtidigt (Amount + V1-V28).
Föreslagna steg:
Class = 1) från train.csv.För varje transaktion i test.csv, förutsäg bedrägerietiketten:
1 = bedrägeri0 = legitim transaktionHuvudmått: F1-score på klass 1.
| F1-score | Poäng |
|---|---|
| F1 >= 0.85 | 80 poäng |
| F1 < 0.60 | 0 poäng |
| Däremellan | Linjär skalning mellan 0 och 80 |
Inlämningsfilen ska vara i CSV-format med följande kolumner:
| Kolumn | Beskrivning |
|---|---|
| subtaskID | Deluppgiftens nummer (1, 2 eller 3) |
| datapointID | Observatörsidentifierare |
| answer | Svaret eller förutsägelsen |
Regler:
datapointID = 1 (endast ett svar).test.csv, med datapointID = värdet i kolumnen id.Exempel:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Notera: Lösningen på detta problem kräver inte användning av Transformer-arkitekturer.