Moeilijkheid
Jouw beste score
N.v.t.
Het doel van dit probleem is het identificeren van frauduleuze creditcardtransacties op basis van een echte, geanonimiseerde dataset. Het probleem weerspiegelt een scenario uit de echte wereld, waarbij de data sterk ongebalanceerd zijn en frauduleuze transacties zeldzaam zijn.
Het project maakt gebruik van twee CSV-bestanden:
train.csv - de dataset voor trainingtest.csv - de dataset voor testen| Kolom | Beschrijving |
|---|---|
| id | Unieke identificatie voor elke transactie |
| Time | Aantal seconden verstreken sinds de eerste transactie |
| V1 - V28 | Geanonimiseerde kenmerken |
| Amount | Waarde van de transactie |
| Class | Doelvariabele (0 = legitieme transactie, 1 = fraude) |
Opmerking: De kolom Class is alleen beschikbaar in train.csv.
Belangrijke observatie: De dataset is ernstig ongebalanceerd, dus accuracy is geen relevante metriek voor het evalueren van classificatiemodellen.
Bepaal hoeveel frauduleuze transacties een Amount hebben die groter is dan het gemiddelde Amount van de legitieme transacties.
Het antwoord is een geheel getal.
Evalueer hoe "abnormaal" de frauduleuze transacties zijn met behulp van de Mahalanobis-afstand, die rekening houdt met alle numerieke variabelen tegelijkertijd (Amount + V1-V28).
Voorgestelde stappen:
Class = 1) uit train.csv.Voorspel voor elke transactie in test.csv het fraudelabel:
1 = fraude0 = legitieme transactieBelangrijkste metriek: F1-score op klasse 1.
| F1-score | Punten |
|---|---|
| F1 >= 0.85 | 80 punten |
| F1 < 0.60 | 0 punten |
| Tussenliggend | Lineaire schaling tussen 0 en 80 |
Het indieningsbestand moet in CSV-formaat zijn met de volgende kolommen:
| Kolom | Beschrijving |
|---|---|
| subtaskID | Nummer van de subtaak (1, 2 of 3) |
| datapointID | Identificatie van de observatie |
| answer | Het antwoord of de voorspelling |
Regels:
datapointID = 1 (één enkel antwoord).test.csv, met datapointID = de waarde uit de kolom id.Voorbeeld:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Opmerking: Het oplossen van dit probleem vereist geen gebruik van Transformer-architecturen.