Dificuldade
A tua melhor pontuação
N/D
Um instituto médico deseja desenvolver um sistema automatizado que ajude na
identificação de pacientes com risco de Alzheimer, usando dados clínicos,
demográficos e comportamentais.
Você recebeu um conjunto de dados com pacientes avaliados clinicamente, e o objetivo é construir
um modelo de classificação binária que possa predizer o diagnóstico para novos pacientes.
Foram disponibilizados os seguintes arquivos:
Objetivo principal: predição da probabilidade de um paciente ser diagnosticado com Alzheimer
(valor entre 0 e 1, onde 0 = paciente saudável, 1 = paciente com Alzheimer).
Cada linha representa um paciente e contém os seguintes atributos:
PatientID – identificador único do pacienteAge – idade do pacienteGender – sexo (0 = feminino, 1 = masculino)Ethnicity – etnia do paciente (valores codificados numericamente)EducationLevel – nível educacional (codificado numericamente)BMI – índice de massa corporalSmoking – fumante (1) / não fumante (0)AlcoholConsumption – consumo de álcoolPhysicalActivity – nível de atividade físicaDietQuality – qualidade da dietaSleepQuality – qualidade do sonoFamilyHistoryAlzheimers – histórico familiar de AlzheimerCardiovascularDisease – doenças cardiovascularesDiabetes – diabetesDepression – depressãoHeadInjury – traumatismos cranianosHypertension – hipertensãoSystolicBP, DiastolicBP – pressão arterialCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – pontuação Mini-Mental State ExaminationFunctionalAssessment – avaliação funcionalADL – atividades diáriasMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – apenas em train.csv
1 = diagnóstico de Alzheimer0 = sem AlzheimerObjetivo final: predizer Diagnosis para as linhas em test.csv.
As duas primeiras subtarefas verificam a análise exploratória dos dados.
A última subtarefa avalia o desempenho do modelo de classificação.
Calcule para cada paciente em test.csv quantos pacientes estão no conjunto de treinamento (train.csv) que têm a mesma idade do paciente no conjunto de teste.
Exiba no arquivo de submissão um número natural (conforme o formato apresentado abaixo).
Para cada paciente em test.csv, determine a porcentagem de pacientes fumantes
(Smoking = 1) do conjunto de treinamento (train.csv) que têm a mesma idade
do paciente respectivo.
Fórmula de cálculo para um paciente com idade v:
(número de pacientes fumantes em train com Age = v) /(número total de pacientes em train com Age = v) * 100Exiba no arquivo de submissão um número real entre 0 e 100,
com no máximo 2 casas decimais, para cada paciente.
Se no conjunto de treinamento não existir nenhum paciente com a idade respectiva,
o valor exibido será 0.
Construa um modelo de classificação que prediga a probabilidade de diagnóstico de Alzheimer
(p ∈ [0,1]) para cada paciente em test.csv.
A avaliação é feita usando ROC Curve e AUC (Area Under the ROC Curve).
As subtarefas 1–2 são avaliadas exatamente (por comparação).
O arquivo submission.csv deve conter 3 linhas para cada paciente em test,
correspondentes às 3 subtarefas.
Estrutura:
subtaskID, datapointID, answeronde:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Para a Subtarefa 3, a avaliação é feita usando ROC AUC (Area Under the ROC Curve),
uma métrica padrão para problemas de classificação binária.