Сложность
Ваш лучший результат
Н/Д
Важным шагом в процессе оцифровки культурного наследия является сбор, структурирование и публикация данных. Без реальных, согласованных и доступных данных любой анализ или цифровое приложение остались бы на чисто теоретическом уровне.
Национальный институт наследия напрямую способствует этому процессу, публикуя наборы открытых данных на правительственной платформе data.gov.ro, предоставляя публичный доступ к официальной информации о культурных учреждениях Румынии. Среди них находится и набор данных о музеях Румынии, который содержит информацию такую как названия музеев, административное расположение, год основания, географические координаты и описательные данные.
В рамках этой задачи вам предстоит выполнить исследовательский анализ для этого набора данных.
Набор данных предоставляется в формате CSV (Comma-Separated Values) и содержит информацию о музеях Румынии, полученную в результате конвертации из формата JSON, опубликованного на платформе data.gov.ro.
Каждая строка в CSV-файле соответствует одному музею, а каждый столбец описывает определенный атрибут этого музея.
Набор данных содержит, среди прочего, следующие столбцы:
_id – внутренний идентификатор записиjudețul – жудец, в котором расположен музейdenumirea (română) – название музея на румынском языкеlocalitatea – населенный пункт, в котором находится музейanul înființării – год основания музеяcategoria (română) – категория музеяlatitudine – географическая координата широтыlongitudine – географическая координата долготыdescrierea (română) – текстовое описание музеяURL – веб-сайт музея (если доступен)Отсутствующие значения отмечены пустыми полями.
Определите общее количество музеев в наборе данных.
Определите количество музеев, для которых в столбце județul находим значение București.
Определите количество столбцов, которые содержат хотя бы одно отсутствующее значение (NaN).
Определите год, в который было основано наибольшее количество музеев, на основе информации, указанной в столбце anul înființării.
Определите для каждого жудеца, который появляется в этом наборе данных, сколько музеев существует в этом жудеце.
Для каждого музея рассчитайте процент заполненных столбцов (non-NaN) от общего количества столбцов. Расчет этого показателя выполняется по следующей формуле:

Определите средний показатель полноты для всего набора данных. Для этого мы сложим показатели, полученные в требовании 6, и разделим общую сумму на количество музеев.
Определите процент музеев, которые имеют максимальный показатель полноты. Определяем максимальный показатель полноты как максимальное значение среди тех, что были определены в задаче 6.
Для автоматической оценки необходимо загрузить файл в формате csv со следующей структурой:
id – идентификатор строки (соответствующий тому, что в test.csv)
ididididid_id из набора данных)ididsubtaskID – идентификатор требования:
1 для общего количества записей (задача 1)2 для количества музеев в Бухаресте (задача 2)3 для количества столбцов с отсутствующими значениями (задача 3)4 для года с наибольшим количеством музеев (задача 4)5 для распределения музеев по жудецам (задача 5)6 для процента заполненных значений (задача 6)7 для среднего показателя полноты (задача 7)8 для музеев с максимальной полнотой (задача 8)answer – ответ, соответствующий каждой задаче
для задачи 1 будет содержать общее количество музеев в наборе данных (значение типа integer)
для задачи 2 будет содержать количество музеев в Бухаресте (значение типа integer)
для задачи 3 будет содержать количество столбцов, которые содержат хотя бы одно отсутствующее значение (NaN) (значение типа integer)
для задачи 4 будет содержать год, в который было основано наибольшее количество музеев (значение типа integer)
для задачи 5 будет содержать количество музеев в каждом жудеце (значение типа integer, по одной строке для каждого жудеца)
для задачи 6 будет содержать процент заполненных полей для каждого музея, рассчитанный как:
(количество заполненных полей / общее количество столбцов) × 100(значение типа float, рекомендуется округлить до 2 десятичных знаков)
для задачи 7 будет содержать средний показатель полноты для всего набора данных (значение типа float, рекомендуется округлить до 2 десятичных знаков)
для задачи 8 будет содержать процент музеев, которые имеют максимальный показатель полноты (значение типа float, рекомендуется округлить до 2 десятичных знаков)