Aufgabe #33
Autor:Mihai Nan
Schwierigkeit
Dein bestes Ergebnis
N/V
Für dieses Problem müssen Sie ein maschinelles Lernmodell implementieren, um den Wert des Feldes Status mithilfe eines verfügbaren Datensatzes vorherzusagen, der Informationen über Patienten enthält. Der Datensatz ist in einer CSV-Datei organisiert, die verschiedene Merkmale (Features) enthält, und die Bewertung des Modells erfolgt basierend auf der Präzision für die Klasse Dead.
Der Datensatz enthält folgende Felder:
Für die ersten Subtasks müssen Sie den Datensatz laden und statistische Analysen auf test.csv durchführen.
Klassifizieren Sie die Nierenfunktion für jeden Patienten aus dem Test-Datensatz basierend auf dem GFR-Wert:
Normal wenn GFR >= 90Mildly Decreased wenn 60 <= GFR < 90Berechnen Sie die Quartile der Werte aus der Spalte Serum Creatinine (Q1, Q2, Q3) für den Trainingsdatensatz und klassifizieren Sie die Patienten aus dem Testdatensatz entsprechend folgendermaßen:
Very Low wenn Serum Creatinine <= Q1Low wenn Q1 < Serum Creatinine <= Q2High wenn Q2 < Serum Creatinine <= Q3Very High wenn Serum Creatinine > Q3Bestimmung des BMI-Werts wie folgt:
Anzahl der Patienten aus train, die sich im gleichen T Stage wie der Patient aus test befinden.
Erstellen Sie ein ML-Modell zur Vorhersage von Status (Dead oder Alive) basierend auf den Merkmalen. Die Bewertung erfolgt basierend auf der Präzision für die Klasse Dead.
Die Bewertungsmetrik ist die Präzision für die Klasse Dead:
Die Punktzahl wird entsprechend dem vom Modell erreichten precision (weighted) Wert vergeben:
| Precision-Intervall | Punktzahl |
|---|---|
| < 0.60 | 0 |
| 0.60 – 0.69 | 10 |
| 0.70 – 0.74 | 20 |
| 0.75 – 0.79 | 30 |
| 0.80 – 0.84 | 40 |
| ≥ 0.85 | 60 |
wobei:
Dead vorhergesagten PatientenDead vorhergesagten PatientenStatus.sample_output für lokale Tests gibt 5 Punkte.Die Datei submission.csv muss die Ergebnisse aller 5 Subtasks für jede Zeile aus dem Test-Datensatz enthalten.
Jede Zeile aus test generiert 5 Zeilen in der Datei, eine für jeden Subtask.
Struktur der Datei:
subtaskID, datapointID, answerBedeutung der Spalten:
Normal / Mildly Decreased / DecreasedVery Low / Low / High / Very High0 oder 11 wenn das Modell Dead vorhersagt, 0 wenn es Alive vorhersagtBeispiel für einen einzelnen Patienten mit ID 3220:
subtaskID datapointID answer1 3220 Normal2 3220 Low3 3220 04 3220 55 3220 1