Vanskelighetsgrad
Din beste poengsum
N/A
Målet med denne oppgaven er å identifisere svindeltransaksjoner med kredittkort basert på et reelt, anonymisert datasett. Problemet gjenspeiler et scenario fra den virkelige verden, der dataene er sterkt ubalanserte og svindeltransaksjoner er sjeldne.
Prosjektet bruker to CSV-filer:
train.csv - datasett for treningtest.csv - datasett for testing| Kolonne | Beskrivelse |
|---|---|
| id | Unik identifikator for hver transaksjon |
| Time | Antall sekunder som har gått siden den første transaksjonen |
| V1 - V28 | Anonymiserte egenskaper |
| Amount | Transaksjonsbeløp |
| Class | Målvariabel (0 = legitim transaksjon, 1 = svindel) |
Merk: Kolonnen Class er kun tilgjengelig i train.csv.
Viktig observasjon: Datasettet er svært ubalansert, så nøyaktighet (accuracy) er ikke en relevant beregning for å evaluere klassifiseringsmodeller.
Bestem hvor mange svindeltransaksjoner som har et Amount som er større enn gjennomsnittlig Amount for legitime transaksjoner.
Svaret er et heltall.
Evaluer hvor "unormale" svindeltransaksjonene er ved å bruke Mahalanobis-avstand, som tar hensyn til alle numeriske variabler samtidig (Amount + V1-V28).
Foreslåtte trinn:
Class = 1) fra train.csv.For hver transaksjon i test.csv, forutsi svindelmerket:
1 = svindel0 = legitim transaksjonHovedmetrikk: F1-score på klasse 1.
| F1-score | Poengsum |
|---|---|
| F1 >= 0.85 | 80 poeng |
| F1 < 0.60 | 0 poeng |
| Mellomliggende | Lineær skalering mellom 0 og 80 |
Innsendingsfilen må være i CSV-format med følgende kolonner:
| Kolonne | Beskrivelse |
|---|---|
| subtaskID | Nummeret på deloppgaven (1, 2 eller 3) |
| datapointID | Identifikator for observasjonen |
| answer | Svaret eller prediksjonen |
Regler:
datapointID = 1 (ett enkelt svar).test.csv, med datapointID = verdien fra id-kolonnen.Eksempel:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Merk: Løsningen av denne oppgaven krever ikke bruk av Transformer-arkitekturer.