Trudność
Twój najlepszy wynik
Nie dotyczy
Celem tego problemu jest identyfikacja oszukańczych transakcji kartami kredytowymi na podstawie rzeczywistego, anonimowego zbioru danych. Problem odzwierciedla scenariusz ze świata rzeczywistego, w którym dane są silnie niezrównoważone, a transakcje oszukańcze występują rzadko.
Projekt wykorzystuje dwa pliki CSV:
train.csv - zbiór danych treningowychtest.csv - zbiór danych testowych| Kolumna | Opis |
|---|---|
| id | Unikalny identyfikator każdej transakcji |
| Time | Liczba sekund, które upłynęły od pierwszej transakcji |
| V1 - V28 | Zanonimizowane cechy |
| Amount | Kwota transakcji |
| Class | Zmienna docelowa (0 = transakcja legalna, 1 = oszustwo) |
Uwaga: Kolumna Class jest dostępna tylko w pliku train.csv.
Ważna obserwacja: Zbiór danych jest silnie niezrównoważony, dlatego accuracy nie jest odpowiednią metryką do oceny modeli klasyfikacyjnych.
Określ, ile oszukańczych transakcji ma wartość Amount większą niż średnia wartość Amount legalnych transakcji.
Odpowiedzią jest liczba całkowita.
Oceń, jak bardzo „anormalne” są oszukańcze transakcje, używając odległości Mahalanobisa, która bierze pod uwagę wszystkie zmienne numeryczne jednocześnie (Amount + V1-V28).
Sugerowane kroki:
Class = 1) z train.csv.Dla każdej transakcji w test.csv przewidź etykietę oszustwa:
1 = oszustwo0 = transakcja legalnaGłówna metryka: F1-score dla klasy 1.
| F1-score | Punktacja |
|---|---|
| F1 >= 0.85 | 80 punktów |
| F1 < 0.60 | 0 punktów |
| Pośrednie | Skalowanie liniowe między 0 a 80 |
Plik zgłoszeniowy musi być w formacie CSV z następującymi kolumnami:
| Kolumna | Opis |
|---|---|
| subtaskID | Numer podzadania (1, 2 lub 3) |
| datapointID | Identyfikator obserwacji |
| answer | Odpowiedź lub predykcja |
Zasady:
datapointID = 1 (pojedyncza odpowiedź).test.csv, gdzie datapointID = wartość z kolumny id.Przykład:
subtaskID,datapointID,answer1,1,422,1,0.273,227846,13,227847,03,227848,0Uwaga: Rozwiązanie tego problemu nie wymaga użycia architektur typu Transformer.