难度
您的最佳成绩
不适用
文化遗产数字化进程中的一个重要步骤是数据的收集、结构化和发布。没有真实、连贯和可访问的数据,任何分析或数字应用都将停留在纯理论层面。
国家遗产研究所通过在政府平台 data.gov.ro 上发布开放数据集,直接参与了这一进程,为公众提供了关于罗马尼亚文化机构的官方信息。其中包括关于罗马尼亚博物馆的数据集,该数据集包含博物馆名称、行政位置、成立年份、地理坐标和描述性数据等信息。
在这个问题中,您需要对该数据集进行探索性分析。
数据集以 CSV(逗号分隔值)格式提供,包含关于罗马尼亚博物馆的信息,这些信息是从 data.gov.ro 平台上发布的 JSON 格式转换而来的。
CSV 文件中的每一行对应一个博物馆,每一列描述该博物馆的某个属性。
数据集包含以下列(其中包括):
_id – 记录的内部标识符județul – 博物馆所在的县denumirea (română) – 博物馆的罗马尼亚语名称localitatea – 博物馆所在的城镇anul înființării – 博物馆成立年份categoria (română) – 博物馆类别latitudine – 纬度地理坐标longitudine – 经度地理坐标descrierea (română) – 博物馆的文字描述URL – 博物馆网站(如果可用)缺失值用空字段标记。
确定数据集中博物馆的总数。
确定在 județul 列中值为 București 的博物馆数量。
确定至少包含一个缺失值(NaN)的列数。
根据 anul înființării 列中的信息,确定成立博物馆最多的年份。
对于该数据集中出现的每个县,确定该县有多少个博物馆。
对于每个博物馆,计算已完成列(非 NaN)占总列数的百分比。该分数的计算使用以下公式:

确定整个数据集的完整性分数平均值。为此,我们将任务 6 得到的分数相加,然后除以博物馆数量。
确定具有最大完整性分数的博物馆百分比。我们将最大完整性分数定义为任务 6 中确定的最大值。
对于自动评估,您需要上传一个 csv 格式的文件,结构如下:
id – 行标识符(对应 test.csv 中的标识符)
ididididid_id 列)ididsubtaskID – 要求标识符:
1 表示记录总数(任务 1)2 表示布加勒斯特博物馆数量(任务 2)3 表示含缺失值的列数(任务 3)4 表示博物馆最多的年份(任务 4)5 表示博物馆在各县的分布(任务 5)6 表示完整值百分比(任务 6)7 表示完整性分数平均值(任务 7)8 表示最大完整性博物馆(任务 8)answer – 每个任务对应的答案
对于任务 1,将包含数据集中的 博物馆总数(整数类型值)
对于任务 2,将包含 布加勒斯特博物馆数量(整数类型值)
对于任务 3,将包含 至少包含一个缺失值(NaN)的列数(整数类型值)
对于任务 4,将包含 成立博物馆最多的年份(整数类型值)
对于任务 5,将包含 每个县的博物馆数量(整数类型值,每个县一行)
对于任务 6,将包含 每个博物馆完成字段的百分比,计算为:
(完成字段数 / 总列数) × 100(浮点类型值,建议四舍五入到 2 位小数)
对于任务 7,将包含 整个数据集的完整性分数平均值(浮点类型值,建议四舍五入到 2 位小数)
对于任务 8,将包含 具有最大完整性分数的博物馆百分比(浮点类型值,建议四舍五入到 2 位小数)