Moeilijkheid
Jouw beste score
N.v.t.
Een essentiële stap in het proces van digitalisering van cultureel erfgoed is het verzamelen, structureren en publiceren van gegevens. Zonder echte, coherente en toegankelijke gegevens zou elke analyse of digitale toepassing op puur theoretisch niveau blijven.
Het Nationaal Instituut voor Erfgoed draagt direct bij aan dit proces door het publiceren van open datasets op het overheidsplatform data.gov.ro, waarbij publieke toegang wordt geboden tot officiële informatie over culturele instellingen in Roemenië. Hieronder valt ook de dataset betreffende de musea in Roemenië, die informatie bevat zoals de namen van musea, administratieve locatie, oprichtingsjaar, geografische coördinaten en beschrijvende gegevens.
In het kader van dit probleem zult u een verkennende analyse moeten uitvoeren voor deze dataset.
De dataset wordt geleverd in CSV-formaat (Comma-Separated Values) en bevat informatie over musea in Roemenië, resulterend uit conversie van een JSON-formaat gepubliceerd op het platform data.gov.ro.
Elke rij in het CSV-bestand komt overeen met een museum, en elke kolom beschrijft een bepaald attribuut daarvan.
De dataset bevat onder andere de volgende kolommen:
_id – interne identificator van de registratiejudețul – de provincie waarin het museum zich bevindtdenumirea (română) – de naam van het museum in het Roemeenslocalitatea – de plaats waar het museum zich bevindtanul înființării – het jaar waarin het museum werd opgerichtcategoria (română) – de categorie van het museumlatitudine – geografische coördinaat van breedtegraadlongitudine – geografische coördinaat van lengtegraaddescrierea (română) – tekstuele beschrijving van het museumURL – website van het museum (indien beschikbaar)Ontbrekende waarden worden gemarkeerd door lege velden.
Bepaal het totaal aantal musea in de dataset.
Bepaal het aantal musea waarvoor in de kolom județul de waarde București wordt gevonden.
Bepaal het aantal kolommen dat ten minste één ontbrekende waarde (NaN) bevat.
Bepaal het jaar waarin de meeste musea werden opgericht, gebaseerd op de informatie die we hebben gespecificeerd in de kolom anul înființării.
Bepaal voor elke provincie die in deze dataset voorkomt, hoeveel musea er in die provincie bestaan.
Voor elk museum, bereken het percentage ingevulde kolommen (non-NaN) van het totaal aantal kolommen. De berekening van deze score wordt uitgevoerd met de volgende formule:

Bepaal het gemiddelde van de compleetheidscore voor de gehele dataset. Hiervoor tellen we de scores verkregen bij vereiste 6 op en delen het totaal door het aantal musea.
Bepaal het percentage musea dat de maximale compleetheidscore heeft. We definiëren de maximale compleetheidscore als de maximale waarde onder die bepaald bij taak 6.
Voor automatische evaluatie moet u een bestand uploaden in csv-formaat met de volgende structuur:
id – identificator van de rij (overeenkomend met die uit test.csv)
ididididid_id uit de dataset)ididsubtaskID – identificator van de vereiste:
1 voor totaal aantal registraties (taak 1)2 voor aantal musea in Boekarest (taak 2)3 voor aantal kolommen met ontbrekende waarden (taak 3)4 voor het jaar met de meeste musea (taak 4)5 voor verdeling van musea per provincie (taak 5)6 voor percentage ingevulde waarden (taak 6)7 voor gemiddelde van de compleetheidscore (taak 7)8 voor musea met maximale compleetheid (taak 8)answer – het antwoord overeenkomend met elke taak
voor taak 1, bevat het totaal aantal musea in de dataset (waarde van type integer)
voor taak 2, bevat het aantal musea in Boekarest (waarde van type integer)
voor taak 3, bevat het aantal kolommen dat ten minste één ontbrekende waarde (NaN) bevat (waarde van type integer)
voor taak 4, bevat het jaar waarin de meeste musea werden opgericht (waarde van type integer)
voor taak 5, bevat het aantal musea in elke provincie (waarde van type integer, één rij voor elke provincie)
voor taak 6, bevat het percentage ingevulde velden voor elk museum, berekend als:
(aantal ingevulde velden / totaal aantal kolommen) × 100(waarde van type float, aanbevolen afgerond op 2 decimalen)
voor taak 7, bevat het gemiddelde van de compleetheidscore voor de gehele dataset (waarde van type float, aanbevolen afgerond op 2 decimalen)
voor taak 8, bevat het percentage musea dat de maximale compleetheidscore heeft (waarde van type float, aanbevolen afgerond op 2 decimalen)