难度
您的最佳成绩
不适用
文化遗产数字化进程中的一个重要步骤是数据的收集、结构化和发布。没有真实、连贯和可访问的数据,任何数字化分析或应用都将停留在纯理论层面。
国家遗产研究所通过在政府平台data.gov.ro上发布开放数据集,直接参与这一进程,为公众提供关于罗马尼亚文化机构的官方信息访问。其中包括关于罗马尼亚博物馆的数据集,该数据集包含博物馆名称、行政位置、成立年份、地理坐标和描述性数据等信息。
在这个问题中,您需要对这个数据集进行探索性分析。
数据集以CSV(逗号分隔值)格式提供,包含关于罗马尼亚博物馆的信息,这些信息是从data.gov.ro平台上发布的JSON格式转换而来的。
CSV文件中的每一行对应一个博物馆,每一列描述博物馆的某个属性。
数据集包含以下列(其中包括):
_id – 记录的内部标识符județul – 博物馆所在的县denumirea (română) – 博物馆的罗马尼亚语名称localitatea – 博物馆所在的城镇anul înființării – 博物馆成立年份categoria (română) – 博物馆类别latitudine – 纬度地理坐标longitudine – 经度地理坐标descrierea (română) – 博物馆的文字描述URL – 博物馆网站(如果可用)缺失值用空字段标记。
确定数据集中博物馆的总数。
确定在județul列中值为București的博物馆数量。
确定包含至少一个缺失值(NaN)的列数。
根据anul înființării列中的信息,确定成立博物馆最多的年份。
对于此数据集中出现的每个县,确定该县有多少个博物馆。
对于每个博物馆,计算已完成(非NaN)列占总列数的百分比。此分数的计算使用以下公式:

确定整个数据集的完整性分数平均值。为此,我们将任务6获得的分数相加,然后除以博物馆数量。
确定具有最大完整性分数的博物馆百分比。我们将最大完整性分数定义为任务6中确定的最大值。
为了自动评估,您需要上传一个csv格式的文件,结构如下:
id – 行标识符(对应test.csv中的标识符)
ididididid_id列)ididsubtaskID – 要求标识符:
1 用于记录总数(任务1)2 用于布加勒斯特的博物馆数量(任务2)3 用于有缺失值的列数(任务3)4 用于博物馆最多的年份(任务4)5 用于博物馆按县分布(任务5)6 用于完整值百分比(任务6)7 用于完整性分数平均值(任务7)8 用于具有最大完整性的博物馆(任务8)answer – 每个任务对应的答案
对于任务1,将包含数据集中的博物馆总数(整数类型值)
对于任务2,将包含布加勒斯特的博物馆数量(整数类型值)
对于任务3,将包含包含至少一个缺失值(NaN)的列数(整数类型值)
对于任务4,将包含成立博物馆最多的年份(整数类型值)
对于任务5,将包含每个县的博物馆数量(整数类型值,每个县一行)
对于任务6,将包含每个博物馆的已完成字段百分比,计算为:
(已完成字段数 / 总列数) × 100(浮点类型值,建议保留2位小数)
对于任务7,将包含整个数据集的完整性分数平均值(浮点类型值,建议保留2位小数)
对于任务8,将包含具有最大完整性分数的博物馆百分比(浮点类型值,建议保留2位小数)