Problemă #24
Autor:Mihai Nan
Dificultate
Maximul tău
N/A
Pentru această problemă trebuie să implementați un model de învățare automată pentru a prezice valoarea câmpului Status utilizând un set de date disponibil, care conține informații despre pacienți. Setul de date este organizat într-un fișier CSV care include diverse trăsături (features), iar evaluarea modelului se va face pe baza preciziei pentru clasa Dead.
Setul de date conține următoarele câmpuri:
Pentru primele subtasks, va trebui să încărcați setul de date și să efectuați analize statistice pe train.csv.
Clasificați funcția renală pentru fiecare pacient pe baza valorii GFR:
Normal dacă GFR >= 90Mildly Decreased dacă 60 <= GFR < 90Calculați cuartilele valorilor din coloana Serum Creatinine (Q1, Q2, Q3) și clasificați pacienții în test:
Very Low dacă Serum Creatinine <= Q1Low dacă Q1 < Serum Creatinine <= Q2High dacă Q2 < Serum Creatinine <= Q3Very High dacă Serum Creatinine > Q3Determinarea valorii BMI:
Numărul de pacienți din train care se află în același T Stage ca pacientul din test.
Construiți un model de ML pentru a prezice Status (Dead sau Alive) în funcție de trăsături. Evaluarea se face pe baza preciziei pentru clasa Dead.
Metrica de evaluare este precizia pentru clasa Dead:
unde:
DeadDead incorectFișierul de submisie trebuie să fie în format CSV (Comma-Separated Values), cu următoarele coloane:
subtaskID,datapointID,answer1,3220,Normal2,3220,Very High3,3220,04,3220,12815,3220,1Status.sample_output pentru testare locală oferă 5 puncte.