Difficulté
Votre meilleur score
N/D
Une étape essentielle dans le processus de numérisation du patrimoine culturel consiste à collecter, structurer et publier des données. Sans données réelles, cohérentes et accessibles, toute analyse ou application numérique resterait à un niveau purement théorique.
L'Institut National du Patrimoine contribue directement à ce processus en publiant des jeux de données ouvertes sur la plateforme gouvernementale data.gov.ro, offrant un accès public aux informations officielles sur les institutions culturelles de Roumanie. Parmi celles-ci figure également le dataset concernant les musées de Roumanie, qui contient des informations telles que la dénomination des musées, la localisation administrative, l'année de fondation, les coordonnées géographiques et des données descriptives.
Dans le cadre de ce problème, vous devrez réaliser une analyse exploratoire pour ce jeu de données.
Le jeu de données est fourni au format CSV (Comma-Separated Values) et contient des informations sur les musées de Roumanie, résultant de la conversion d'un format JSON publié sur la plateforme data.gov.ro.
Chaque ligne du fichier CSV correspond à un musée, et chaque colonne décrit un certain attribut de celui-ci.
Le jeu de données contient, entre autres, les colonnes suivantes :
_id – identifiant interne de l'enregistrementjudețul – le département dans lequel est localisé le muséedenumirea (română) – le nom du musée en langue roumainelocalitatea – la localité dans laquelle se trouve le muséeanul înființării – l'année de fondation du muséecategoria (română) – la catégorie du muséelatitudine – coordonnée géographique de latitudelongitudine – coordonnée géographique de longitudedescrierea (română) – description textuelle du muséeURL – site web du musée (si disponible)Les valeurs manquantes sont marquées par des champs vides.
Déterminez le nombre total de musées dans le dataset.
Déterminez le nombre de musées pour lesquels dans la colonne județul nous trouvons la valeur București.
Déterminez le nombre de colonnes qui contiennent au moins une valeur manquante (NaN).
Déterminez l'année durant laquelle ont été fondés le plus de musées, sur la base des informations que nous avons spécifiées dans la colonne anul înființării.
Déterminez pour chaque département, qui apparaît dans ce jeu de données, combien de musées existent dans ce département.
Pour chaque musée, calculez le pourcentage de colonnes complétées (non-NaN) du total des colonnes. Le calcul de ce score est réalisé en utilisant la formule suivante :

Déterminez la moyenne du score de complétude pour l'ensemble du dataset. Pour cela, nous additionnerons les scores obtenus à l'exigence 6 et diviserons le total par le nombre de musées.
Déterminez le pourcentage de musées qui ont le score de complétude maximal. Nous définissons le score de complétude maximal comme étant la valeur maximale parmi celles déterminées à la tâche 6.
Pour l'évaluation automatique, vous devez télécharger un fichier au format csv avec la structure suivante :
id – identifiant de la ligne (correspondant à celui de test.csv)
ididididid_id du jeu de données)ididsubtaskID – identifiant de l'exigence :
1 pour le nombre total d'enregistrements (tâche 1)2 pour le nombre de musées de Bucarest (tâche 2)3 pour le nombre de colonnes avec des valeurs manquantes (tâche 3)4 pour l'année avec le plus de musées (tâche 4)5 pour la distribution des musées par départements (tâche 5)6 pour le pourcentage des valeurs complétées (tâche 6)7 pour la moyenne du score de complétude (tâche 7)8 pour les musées avec complétude maximale (tâche 8)answer – réponse correspondant à chaque tâche
pour la tâche 1, contiendra le nombre total de musées dans le dataset (valeur de type integer)
pour la tâche 2, contiendra le nombre de musées de Bucarest (valeur de type integer)
pour la tâche 3, contiendra le nombre de colonnes qui contiennent au moins une valeur manquante (NaN) (valeur de type integer)
pour la tâche 4, contiendra l'année durant laquelle ont été fondés le plus de musées (valeur de type integer)
pour la tâche 5, contiendra le nombre de musées dans chaque département (valeur de type integer, une ligne pour chaque département)
pour la tâche 6, contiendra le pourcentage de champs complétés pour chaque musée, calculé comme :
(nombre champs complétés / nombre total colonnes) × 100(valeur de type float, recommandé arrondi à 2 décimales)
pour la tâche 7, contiendra la moyenne du score de complétude pour l'ensemble du dataset (valeur de type float, recommandé arrondi à 2 décimales)
pour la tâche 8, contiendra le pourcentage de musées qui ont le score de complétude maximal (valeur de type float, recommandé arrondi à 2 décimales)