Difficoltà
Il tuo miglior punteggio
N/D
Un passo essenziale nel processo di digitalizzazione del patrimonio culturale è rappresentato dalla raccolta, strutturazione e pubblicazione dei dati. Senza dati reali, coerenti e accessibili, qualsiasi analisi o applicazione digitale rimarrebbe a livello puramente teorico.
L'Istituto Nazionale del Patrimonio contribuisce direttamente a questo processo attraverso la pubblicazione di set di dati aperti sulla piattaforma governativa data.gov.ro, offrendo accesso pubblico a informazioni ufficiali sulle istituzioni culturali della Romania. Tra questi si trova anche il dataset relativo ai musei della Romania, che contiene informazioni come la denominazione dei musei, la localizzazione amministrativa, l'anno di fondazione, le coordinate geografiche e dati descrittivi.
Nel contesto di questo problema dovrete realizzare un'analisi esplorativa per questo set di dati.
Il set di dati è fornito in formato CSV (Comma-Separated Values) e contiene informazioni sui musei della Romania, risultanti dalla conversione da un formato JSON pubblicato sulla piattaforma data.gov.ro.
Ogni riga del file CSV corrisponde a un museo, e ogni colonna descrive un determinato attributo di questo.
Il set di dati contiene, tra gli altri, le seguenti colonne:
_id – identificatore interno della registrazionejudețul – la contea in cui è localizzato il museodenumirea (română) – il nome del museo in lingua rumenalocalitatea – la località in cui si trova il museoanul înființării – l'anno in cui è stato fondato il museocategoria (română) – la categoria del museolatitudine – coordinata geografica di latitudinelongitudine – coordinata geografica di longitudinedescrierea (română) – descrizione testuale del museoURL – sito web del museo (se disponibile)I valori mancanti sono marcati attraverso campi vuoti.
Determinate il numero totale di musei nel dataset.
Determinate il numero di musei per i quali nella colonna județul troviamo il valore București.
Determinate il numero di colonne che contengono almeno un valore mancante (NaN).
Determinate l'anno in cui sono stati fondati il maggior numero di musei, sulla base delle informazioni che abbiamo specificate nella colonna anul înființării.
Determinate per ogni contea, che appare in questo set di dati, quanti musei esistono in quella contea.
Per ogni museo, calcolate la percentuale di colonne completate (non-NaN) dal totale delle colonne. Il calcolo di questo punteggio è realizzato utilizzando la seguente formula:

Determinate la media del punteggio di completezza per l'intero dataset. Per questo, sommeremo i punteggi ottenuti al requisito 6 e divideremo il totale per il numero di musei.
Determinate la percentuale di musei che hanno il punteggio di completezza massimo. Definiamo il punteggio di completezza massimo come il valore massimo tra quelli determinati al task 6.
Per la valutazione automatica dovete caricare un file in formato csv con la seguente struttura:
id – identificatore della riga (corrispondente a quello di test.csv)
ididididid_id dal set di dati)ididsubtaskID – identificatore del requisito:
1 per il numero totale di registrazioni (task 1)2 per il numero di musei di Bucarest (task 2)3 per il numero di colonne con valori mancanti (task 3)4 per l'anno con il maggior numero di musei (task 4)5 per la distribuzione dei musei per contee (task 5)6 per la percentuale dei valori completati (task 6)7 per la media del punteggio di completezza (task 7)8 per i musei con completezza massima (task 8)answer – risposta corrispondente a ogni task
per il task 1, conterrà il numero totale di musei nel dataset (valore di tipo integer)
per il task 2, conterrà il numero di musei di Bucarest (valore di tipo integer)
per il task 3, conterrà il numero di colonne che contengono almeno un valore mancante (NaN) (valore di tipo integer)
per il task 4, conterrà l'anno in cui sono stati fondati il maggior numero di musei (valore di tipo integer)
per il task 5, conterrà il numero di musei di ogni contea (valore di tipo integer, una riga per ogni contea)
per il task 6, conterrà la percentuale dei campi completati per ogni museo, calcolata come:
(numero campi completati / numero totale colonne) × 100(valore di tipo float, raccomandato arrotondato a 2 decimali)
per il task 7, conterrà la media del punteggio di completezza per l'intero dataset (valore di tipo float, raccomandato arrotondato a 2 decimali)
per il task 8, conterrà la percentuale di musei che hanno il punteggio di completezza massimo (valore di tipo float, raccomandato arrotondato a 2 decimali)