Sværhedsgrad
Din bedste score
N/A
Formålet med denne opgave er at identificere svigagtige kreditkorttransaktioner baseret på et reelt, anonymiseret datasæt. Problemet afspejler et scenarie fra den virkelige verden, hvor data er stærkt ubalancerede, og svigagtige transaktioner er sjældne.
Projektet anvender to CSV-filer:
train.csv - datasæt til træningtest.csv - datasæt til test| Kolonne | Beskrivelse |
|---|---|
| id | Unik identifikator for hver transaktion |
| Time | Antal sekunder forløbet siden den første transaktion |
| V1 - V28 | Anonymiserede funktioner |
| Amount | Transaktionsbeløb |
| Class | Målvariabel (0 = legitim transaktion, 1 = svindel) |
Bemærk: Kolonnen Class er kun tilgængelig i train.csv.
Vigtig observation: Datasættet er alvorligt ubalanceret, så accuracy er ikke en relevant metrik til evaluering af klassifikationsmodeller.
Bestem hvor mange svigagtige transaktioner der har et Amount, der er større end gennemsnittet af Amount for legitime transaktioner.
Svaret er et heltal.
Evaluer hvor "anormale" de svigagtige transaktioner er ved hjælp af Mahalanobis-distancen, som tager højde for alle numeriske variabler samtidigt (Amount + V1-V28).
Foreslåede trin:
Class = 1) fra train.csv.For hver transaktion i test.csv skal du forudsige svindel-mærkatet:
1 = svindel0 = legitim transaktionHovedmetrik: F1-score på klasse 1.
| F1-score | Point |
|---|---|
| F1 >= 0.85 | 80 point |
| F1 < 0.60 | 0 point |
| Imellem | Lineær skalering mellem 0 og 80 |
Indsendelsesfilen skal være i CSV-format med følgende kolonner:
| Kolonne | Beskrivelse |
|---|---|
| subtaskID | Subtask-nummer (1, 2 eller 3) |
| datapointID | Identifikator for observationen |
| answer | Svaret eller forudsigelsen |
Regler:
datapointID = 1 (ét enkelt svar).test.csv, med datapointID = værdien fra kolonnen id.Eksempel:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Bemærk: Løsning af denne opgave kræver ikke brug af Transformer-arkitekturer.