Складність
Ваш найкращий результат
Н/Д
Вас найняли як data scientist у невелику «лабораторію економічних прогнозів». Ваше завдання — з'ясувати, хто долає бар'єр у 50 000 доларів США на рік, а хто ні, використовуючи реальні дані про освіту, роботу та повсякденне життя. У вашому розпорядженні два файли з соціально-економічними даними, описаними нижче:
| Колонка | Опис |
|---|---|
| sampleid | Унікальний ідентифікатор для кожного спостереження |
| age | Вік особи |
| workclass | Тип роботодавця (наприклад: Private, Self-emp-not-inc тощо) |
| fnlwgt | Фінальна вага з перепису (final weight) |
| education | Рівень освіти (наприклад: Bachelors, Masters тощо) |
| educational_num | Числове представлення рівня освіти |
| marital_status | Сімейний стан |
| occupation | Професія |
| relationship | Роль у домогосподарстві |
| race | Раса |
| gender | Стать |
| capital_gain | Прибуток від капіталу |
| capital_loss | Збитки від капіталу |
| hours_per_week | Кількість робочих годин на тиждень |
| native_country | Країна походження |
| profile_description | Текстовий опис професійного профілю |
| income | Річний дохід (<=50K / >50K) – цільова колонка |
Примітка:
Колонка income доступна лише в навчальних даних (train.csv).
Проаналізуйте навчальні дані (train.csv) і визначте:
Яка країна походження (native_country), крім United-States, має найбільшу кількість осіб із доходом >50K?
Результатом має бути рядок із точною назвою країни, як вона вказана в даних.
Проаналізуйте навчальні дані (train.csv) і визначте:
Яка професія (occupation) має найвищий рівень доходу >50K?
Рівень доходу >50K для професії розраховується як: кількість осіб із доходом >50K у цій професії, поділена на загальну кількість осіб у цій професії.
Результатом має бути рядок із точною назвою професії, як вона вказана в даних.
Побудуйте модель класифікації, здатну передбачити значення колонки income для всіх спостережень із test.csv.
Модель повинна видавати один із двох класів:
<=50K>50KКолонка profile_description містить текстові описи професійних профілів. Застосуйте метод кластеризації до цієї колонки, щоб згрупувати спостереження з test.csv у кластери.
Поверніть для кожного спостереження з test.csv мітку кластера (ціле числове значення).
Підзавдання 1: Точна відповідність правильній відповіді.
Підзавдання 2: Точна відповідність правильній відповіді.
Підзавдання 3: Оцінювання проводиться за допомогою F1 Macro:
f1_macro ≥ 0.80 → 55 балівf1_macro < 0.60 → 0 балівПідзавдання 4: Оцінювання проводиться за допомогою Adjusted Rand Index (ARI):
ARI ≥ 0.90 → 20 балівARI ≤ 0.00 → 0 балівФайл для відправки має бути у форматі CSV з наступними колонками:
subtaskID – індекс підзавданняdatapointID – унікальний ідентифікатор із набору данихanswer – відповідь або прогнозПриклад:
subtaskID,datapointID,answer1,1,India2,2,Sales3,10001,<=50K3,10002,>50K4,10001,04,10002,2Примітка:
datapointID має бути 1 та 2 відповідно.datapointID має бути значенням sampleid із test.csv.Adult / Census Income Dataset – UCI Machine Learning Repository