Сложность
Ваш лучший результат
Н/Д
Медицинский институт хочет разработать автоматизированную систему, которая поможет в
выявлении пациентов с риском болезни Альцгеймера, используя клинические,
демографические и поведенческие данные.
Вы получили набор данных с клинически обследованными пациентами, и цель состоит в том, чтобы построить
модель бинарной классификации, которая сможет предсказать диагноз для новых пациентов.
Вам предоставлены следующие файлы:
Основная цель: предсказание вероятности того, что у пациента будет диагностирована болезнь Альцгеймера
(значение между 0 и 1, где 0 = здоровый пациент, 1 = пациент с болезнью Альцгеймера).
Каждая строка представляет пациента и содержит следующие атрибуты:
PatientID – уникальный идентификатор пациентаAge – возраст пациентаGender – пол (0 = женский, 1 = мужской)Ethnicity – этническая принадлежность пациента (числовые закодированные значения)EducationLevel – уровень образования (числовое кодирование)BMI – индекс массы телаSmoking – курящий (1) / некурящий (0)AlcoholConsumption – потребление алкоголяPhysicalActivity – уровень физической активностиDietQuality – качество диетыSleepQuality – качество снаFamilyHistoryAlzheimers – семейная история болезни АльцгеймераCardiovascularDisease – сердечно-сосудистые заболеванияDiabetes – диабетDepression – депрессияHeadInjury – черепно-мозговые травмыHypertension – гипертонияSystolicBP, DiastolicBP – артериальное давлениеCholesterolTotal, CholesterolLDL, CholesterolHDL, CholesterolTriglyceridesMMSE – балл Mini-Mental State ExaminationFunctionalAssessment – функциональная оценкаADL – повседневная деятельностьMemoryComplaintsBehavioralProblemsConfusionDisorientationPersonalityChangesDifficultyCompletingTasksForgetfulnessDiagnosis – только в train.csv
1 = диагноз болезни Альцгеймера0 = без болезни АльцгеймераКонечная цель: предсказать Diagnosis для строк из test.csv.
Первые две подзадачи проверяют исследовательский анализ данных.
Последняя подзадача оценивает производительность модели классификации.
Вычислите для каждого пациента из test.csv, сколько пациентов в тренировочном наборе (train.csv) имеют тот же возраст, что и пациент из тестового набора.
Выведите в файл подачи натуральное число (согласно формату, представленному ниже).
Для каждого пациента из test.csv определите процент курящих пациентов
(Smoking = 1) из тренировочного набора (train.csv) которые имеют тот же возраст
что и соответствующий пациент.
Формула расчета для пациента с возрастом v:
(количество курящих пациентов из train с Age = v) /(общее количество пациентов из train с Age = v) * 100Выведите в файл подачи вещественное число между 0 и 100,
с максимум 2 десятичными знаками, для каждого пациента.
Если в тренировочном наборе нет ни одного пациента с соответствующим возрастом,
выводимое значение будет 0.
Постройте модель классификации, которая предсказывает вероятность диагноза болезни Альцгеймера
(p ∈ [0,1]) для каждого пациента из test.csv.
Оценка проводится с использованием ROC Curve и AUC (Area Under the ROC Curve).
Подзадачи 1–2 оцениваются точно (путем сравнения).
Файл submission.csv должен содержать 3 строки для каждого пациента из test,
соответствующие 3 подзадачам.
Структура:
subtaskID, datapointID, answerгде:
PatientIDPatientID = 4751:subtaskID,datapointID,answer1,4751,232,4751,31.83,4751,0.873Для Подзадачи 3 оценка проводится с использованием ROC AUC (Area Under the ROC Curve),
стандартной метрики для задач бинарной классификации.