Zadanie #33
Autor:Mihai Nan
Trudność
Twój najlepszy wynik
Nie dotyczy
Dla tego problemu musisz zaimplementować model uczenia maszynowego do przewidywania wartości pola Status używając dostępnego zbioru danych, który zawiera informacje o pacjentach. Zbiór danych jest zorganizowany w pliku CSV, który zawiera różne cechy (features), a ocena modelu będzie się odbywać na podstawie precyzji dla klasy Dead.
Zbiór danych zawiera następujące pola:
Dla pierwszych podzadań będziesz musiał załadować zbiór danych i przeprowadzić analizy statystyczne na test.csv.
Sklasyfikuj funkcję nerek dla każdego pacjenta ze zbioru testowego na podstawie wartości GFR:
Normal jeśli GFR >= 90Mildly Decreased jeśli 60 <= GFR < 90Oblicz kwartyle wartości z kolumny Serum Creatinine (Q1, Q2, Q3) dla zbioru danych treningowych i sklasyfikuj pacjentów ze zbioru danych testowych zgodnie z następującymi kryteriami:
Very Low jeśli Serum Creatinine <= Q1Low jeśli Q1 < Serum Creatinine <= Q2High jeśli Q2 < Serum Creatinine <= Q3Very High jeśli Serum Creatinine > Q3Określenie wartości BMI w następujący sposób:
Liczba pacjentów z train, którzy znajdują się w tym samym T Stage co pacjent z test.
Zbuduj model ML do przewidywania Status (Dead lub Alive) w zależności od cech. Ocena odbywa się na podstawie precyzji dla klasy Dead.
Metryką oceny jest precyzja dla klasy Dead:
Punkty są przyznawane w zależności od wartości precision (weighted) uzyskanej przez model:
| Przedział precision | Punkty |
|---|---|
| < 0.60 | 0 |
| 0.60 – 0.69 | 10 |
| 0.70 – 0.74 | 20 |
| 0.75 – 0.79 | 30 |
| 0.80 – 0.84 | 40 |
| ≥ 0.85 | 60 |
gdzie:
DeadDeadStatus.sample_output do testowania lokalnego daje 5 punktów.Plik submission.csv musi zawierać wyniki wszystkich 5 podzadań dla każdego wiersza ze zbioru test.
Każdy wiersz z test generuje 5 linii w pliku, po jednej dla każdego podzadania.
Struktura pliku:
subtaskID, datapointID, answerZnaczenie kolumn:
Normal / Mildly Decreased / DecreasedVery Low / Low / High / Very High0 lub 11 jeśli model przewiduje Dead, 0 jeśli przewiduje AlivePrzykład dla jednego pacjenta z ID 3220:
subtaskID datapointID answer1 3220 Normal2 3220 Low3 3220 04 3220 55 3220 1