Moeilijkheid
Jouw beste score
N.v.t.
Een essentiële stap in het proces van digitalisering van cultureel erfgoed is het verzamelen, structureren en publiceren van gegevens. Zonder echte, coherente en toegankelijke gegevens zou elke analyse of digitale toepassing op puur theoretisch niveau blijven.
Het Nationaal Instituut voor Erfgoed draagt direct bij aan dit proces door het publiceren van open datasets op het overheidsplatform data.gov.ro, waarbij publieke toegang wordt geboden tot officiële informatie over culturele instellingen in Roemenië. Hieronder valt ook de dataset betreffende de musea in Roemenië, die informatie bevat zoals de namen van musea, administratieve locatie, oprichtingsjaar, geografische coördinaten en beschrijvende gegevens.
In het kader van dit probleem zult u een verkennende analyse uitvoeren voor deze dataset.
De dataset wordt geleverd in CSV-formaat (Comma-Separated Values) en bevat informatie over musea in Roemenië, resulterend uit de conversie van een JSON-formaat gepubliceerd op het platform data.gov.ro.
Elke rij in het CSV-bestand komt overeen met een museum, en elke kolom beschrijft een bepaald attribuut daarvan.
De dataset bevat onder andere de volgende kolommen:
_id – interne identificator van de recordjudețul – de provincie waarin het museum zich bevindtdenumirea (română) – de naam van het museum in het Roemeenslocalitatea – de plaats waar het museum zich bevindtanul înființării – het jaar waarin het museum werd opgerichtcategoria (română) – de categorie van het museumlatitudine – geografische coördinaat van de breedtegraadlongitudine – geografische coördinaat van de lengtegraaddescrierea (română) – tekstuele beschrijving van het museumURL – website van het museum (indien beschikbaar)Ontbrekende waarden worden gemarkeerd door lege velden.
Bepaal het totale aantal musea in de dataset.
Bepaal het aantal musea waarvoor in de kolom județul de waarde București wordt gevonden.
Bepaal het aantal kolommen dat ten minste één ontbrekende waarde (NaN) bevat.
Bepaal het jaar waarin de meeste musea werden opgericht, gebaseerd op de informatie die we hebben gespecificeerd in de kolom anul înființării.
Bepaal voor elke provincie die in deze dataset voorkomt, hoeveel musea er in die provincie bestaan.
Voor elk museum, bereken het percentage voltooide kolommen (non-NaN) van het totale aantal kolommen. De berekening van deze score wordt uitgevoerd met behulp van de volgende formule:

Bepaal het gemiddelde van de volledigheidscore voor de gehele dataset. Hiervoor tellen we de scores verkregen bij vereiste 6 op en delen we het totaal door het aantal musea.
Bepaal het percentage musea dat de maximale volledigheidscore heeft. We definiëren de maximale volledigheidscore als de maximale waarde onder die bepaald bij taak 6.
Voor automatische evaluatie moet u een bestand uploaden in csv-formaat met de volgende structuur:
id – identificator van de rij (overeenkomend met die uit test.csv)
ididididid_id uit de dataset)ididsubtaskID – identificator van de vereiste:
1 voor het totale aantal records (taak 1)2 voor het aantal musea in Boekarest (taak 2)3 voor het aantal kolommen met ontbrekende waarden (taak 3)4 voor het jaar met de meeste musea (taak 4)5 voor de verdeling van musea per provincie (taak 5)6 voor het percentage voltooide waarden (taak 6)7 voor het gemiddelde van de volledigheidscore (taak 7)8 voor musea met maximale volledigheid (taak 8)answer – het antwoord overeenkomend met elke taak
voor taak 1, zal het het totale aantal musea in de dataset bevatten (waarde van type integer)
voor taak 2, zal het het aantal musea in Boekarest bevatten (waarde van type integer)
voor taak 3, zal het het aantal kolommen dat ten minste één ontbrekende waarde (NaN) bevat bevatten (waarde van type integer)
voor taak 4, zal het het jaar waarin de meeste musea werden opgericht bevatten (waarde van type integer)
voor taak 5, zal het het aantal musea in elke provincie bevatten (waarde van type integer, één rij voor elke provincie)
voor taak 6, zal het het percentage voltooide velden voor elk museum bevatten, berekend als:
(aantal voltooide velden / totaal aantal kolommen) × 100(waarde van type float, aanbevolen afgerond op 2 decimalen)
voor taak 7, zal het het gemiddelde van de volledigheidscore voor de gehele dataset bevatten (waarde van type float, aanbevolen afgerond op 2 decimalen)
voor taak 8, zal het het percentage musea dat de maximale volledigheidscore heeft bevatten (waarde van type float, aanbevolen afgerond op 2 decimalen)