Сложность
Ваш лучший результат
Н/Д
На протяжении многих лет результаты экзамена Бакалавриат дают детальную картину успеваемости лицеев Румынии. Анализируя исторические данные за несколько лет, мы можем обнаружить тенденции, эволюцию школьной успеваемости и, иногда, результаты, выходящие за рамки обычного.
В этом контексте цель данной задачи состоит в статистическом анализе успеваемости лицеев на экзамене Бакалавриат, построении прогностических моделей и выявлении атипичных результатов с использованием методов машинного обучения.
Для решения требований этой задачи у вас есть доступ к структурированному набору данных в виде двух csv файлов: train.csv и test.csv. Этот набор данных содержит агрегированные результаты лицеев по различным предметам экзамена Бакалавриат за период 2014–2023.
Каждая строка в наборе данных (независимо от того, идет ли речь о тренировочном наборе или тестовом) представляет результаты лицея по предмету в году.
id – уникальный идентификатор строкиan – год экзаменаliceu – название лицеяjudet – уезд, в котором находится лицейmaterie – дисциплина Бакалавриатаmedie – средний балл, полученный учениками лицея по соответствующей дисциплинеprocent_reusita – процент учеников, сдавших экзаменnumar_candidati – количество кандидатовpreferinta_materie – процент учеников, выбравших соответствующую дисциплинуanomalie - может иметь значение 0, если не считается аномальной ситуацией, или значение 1, если ситуация необычная.Примечание: Для каждого лицея у нас также есть общая статистика. Для них в столбце materie находим значение GENERAL.
Файл train.csv содержит статистику за период 2014-2022, а файл test.csv содержит данные за 2023 год, однако столбцы medie и anomalie недоступны.
Определите, какой предмет имел наибольшее предпочтение в 2023 году в COLEGIUL NATIONAL "UNIREA" FOCSANI, если исключить предмет LIMBA ROMANA, который был обязательным для всех кандидатов.
Определите, в каком году из периода 2014-2022 предмет INFORMATICA MI C-C++ имел наибольшую популярность в COLEGIUL NATIONAL "UNIREA" FOCSANI. Считаем, что популярность определяется процентом из столбца preferinta_materie (чем выше этот процент, тем более популярным мы будем считать предмет).
Используя информацию, доступную в файле train.csv, оцените значение полученного среднего балла для каждой строки из файла test.csv (2023 год).
Для этого требования вы можете использовать любой метод статистического анализа или моделирования на основе исторических данных, учитывая:
Цель - получение оценок, максимально близких к реальным значениям.
Проанализируйте исторические данные за период 2014–2022 и решите для каждой строки из файла test.csv, является ли соответствующий результат 2023 года:
При принятии решения вы можете учитывать:
Итоговый результат для каждой строки должен быть бинарной меткой:
0 - нормальный результат1 - атипичный результатДля автоматической оценки необходимо загрузить файл в формате csv со следующей структурой:
id – идентификатор строки (соответствующий тому, что в test.csv)
ididsubtaskID – идентификатор требования:
1 для определения предпочитаемого предмета (требование 1)2 для определения успешного года для Информатики (требование 2)3 для оценки среднего балла (требование 3)4 для выявления атипичных результатов (требование 4)answer – ответ, соответствующий требованию:
subtaskID = 1: название предмета точно так, как оно появляется в наборе данныхsubtaskID = 2: годsubtaskID = 3: числовое значение (оценка среднего балла)subtaskID = 4: 0 или 1Для требований 1–2 оценка производится точно (путем сравнения).
Для требования 3 оценка производится с использованием Mean Absolute Error (MAE).
Правила:
Для требования 4 балл присуждается согласно следующим правилам: