Problema #22
Autor:Mihai Nan
Dificuldade
A tua melhor pontuação
N/D
Deseja-se construir um modelo de classificação que preveja se um paciente tem diabetes com base em exames de sangue e dados demográficos.
Cada paciente é caracterizado por 8 atributos numéricos obtidos de análises e medições clínicas, e o rótulo (target) indica a presença de diabetes (1 para positivo, 0 para negativo).
Este tipo de problema pertence à categoria de classificação binária (binary classification).
pregnancies – número de gestaçõesglucose – nível de glicose no sangueblood_pressure – pressão arterialskin_thickness – espessura da dobra cutâneainsulin – nível de insulinabmi – índice de massa corporaldiabetes_pedigree_function – escore genético de riscoage – idade do pacientetrain.csvContém todas as 8 colunas de features mais a coluna:
target – indica a presença de diabetes (0 ou 1)Exemplo:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age | target |
|---|---|---|---|---|---|---|---|---|---|
| 1 | 6 | 148 | 72 | 35 | 0 | 33.6 | 0.627 | 50 | 1 |
| 2 | 1 | 85 | 66 | 29 | 0 | 26.6 | 0.351 | 31 | 0 |
test.csvContém as mesmas colunas sem target, mas inclui SampleID.
Exemplo:
| SampleID | pregnancies | glucose | blood_pressure | skin_thickness | insulin | bmi | diabetes_pedigree_function | age |
|---|---|---|---|---|---|---|---|---|
| 1 | 0 | 137 | 40 | 35 | 168 | 43.1 | 2.288 | 33 |
| 2 | 5 | 116 | 74 | 0 | 0 | 25.6 | 0.201 | 30 |
O arquivo de saída (submission.csv) deve conter exatamente duas colunas:
SampleIDlabel – rótulo previsto pelo modelo (0 ou 1)Exemplo:
| SampleID | label |
|---|---|
| 1 | 1 |
| 2 | 0 |
| 3 | 0 |
A avaliação dos modelos será feita utilizando a seguinte métrica:
Esta métrica é adequada para classificação binária, pois dá importância igual à correção das previsões para ambas as classes.
Fórmula geral:
onde:
O escore final é expresso como porcentagem (0–100), arredondado para duas casas decimais.
O dataset provém da coleção original:
Pima Indians Diabetes Database – Kaggle