Problema #22
Autor:Mihai Nan
Dificultad
Tu mejor puntuación
N/D
Se desea construir un modelo de clasificación que prediga si un paciente tiene diabetes basándose en análisis de sangre y datos demográficos.
Cada paciente está caracterizado por 8 atributos numéricos obtenidos de análisis y mediciones clínicas, y la etiqueta (target) indica la presencia de diabetes (1 para positivo, 0 para negativo).
Este tipo de problema pertenece a la categoría de clasificación binaria (binary classification).
pregnancies – número de embarazosglucose – nivel de glucosa en sangreblood_pressure – presión arterialskin_thickness – grosor del pliegue cutáneoinsulin – nivel de insulinabmi – índice de masa corporaldiabetes_pedigree_function – puntuación genética de riesgoage – edad del pacientetrain.csvContiene todas las 8 columnas de features más la columna:
target – indica la presencia de diabetes (0 o 1)Ejemplo:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvContiene las mismas columnas sin target, pero incluye SampleID.
Ejemplo:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
El archivo de salida (submission.csv) debe contener exactamente dos columnas:
SampleIDlabel – etiqueta predicha por el modelo (0 o 1)Ejemplo:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
La evaluación de los modelos se realizará utilizando la siguiente métrica:
Esta métrica es adecuada para la clasificación binaria, ya que otorga igual importancia a la corrección de las predicciones para ambas clases.
Fórmula general:
donde:
La puntuación final se expresa como porcentaje (0–100), redondeado a dos decimales.
El dataset proviene de la colección original:
Pima Indians Diabetes Database – Kaggle