Svårighetsgrad
Din bästa poäng
Ej tillgänglig
Ett väsentligt steg i processen för digitalisering av kulturarvet är insamling, strukturering och publicering av data. Utan verkliga, sammanhängande och tillgängliga data skulle alla analyser eller digitala applikationer förbli på en rent teoretisk nivå.
Nationella institutet för kulturarv bidrar direkt till denna process genom att publicera öppna dataset på den statliga plattformen data.gov.ro, vilket ger allmän tillgång till officiell information om kulturinstitutioner i Rumänien. Bland dessa finns även datasetet som rör museer i Rumänien, vilket innehåller information som museinamn, administrativ lokalisering, grundningsår, geografiska koordinater och beskrivande data.
I denna uppgift ska ni genomföra en explorativ analys av detta dataset.
Datasetet tillhandahålls i CSV-format (Comma-Separated Values) och innehåller information om museer i Rumänien, resultat av konvertering från ett JSON-format publicerat på plattformen data.gov.ro.
Varje rad i CSV-filen motsvarar ett museum, och varje kolumn beskriver ett visst attribut för detta.
Datasetet innehåller bland annat följande kolumner:
_id – intern identifierare för postenjudețul – det län där museet är lokaliseratdenumirea (română) – museets namn på rumänskalocalitatea – orten där museet finnsanul înființării – året då museet grundadescategoria (română) – museets kategorilatitudine – geografisk latitudkoordinatlongitudine – geografisk longitudkoordinatdescrierea (română) – textbeskrivning av museetURL – museets webbplats (om tillgänglig)Saknade värden markeras genom tomma fält.
Bestäm det totala antalet museer i datasetet.
Bestäm antalet museer för vilka vi i kolumnen județul finner värdet București.
Bestäm antalet kolumner som innehåller minst ett saknat värde (NaN).
Bestäm året då flest museer grundades, baserat på informationen vi har specificerad i kolumnen anul înființării.
Bestäm för varje län som förekommer i detta dataset hur många museer som finns i det länet.
För varje museum, beräkna procenten av ifyllda kolumner (non-NaN) av det totala antalet kolumner. Beräkningen av denna poäng görs med följande formel:

Bestäm medelvärdet av fullständighetspoängen för hela datasetet. För detta adderar vi poängen från krav 6 och delar summan med antalet museer.
Bestäm procenten av museer som har maximal fullständighetspoäng. Vi definierar maximal fullständighetspoäng som det maximala värdet bland de som bestämdes i task 6.
För automatisk utvärdering måste ni ladda upp en fil i csv-format med följande struktur:
id – radidentifierare (motsvarande den i test.csv)
ididididid_id från datasetet)ididsubtaskID – kravsidentifierare:
1 för totalt antal poster (task 1)2 för antal museer i Bukarest (task 2)3 för antal kolumner med saknade värden (task 3)4 för året med flest museer (task 4)5 för fördelning av museer per län (task 5)6 för procent av ifyllda värden (task 6)7 för medelvärde av fullständighetspoäng (task 7)8 för museer med maximal fullständighet (task 8)answer – svaret motsvarande varje task
för task 1, kommer att innehålla totalt antal museer i datasetet (värde av typ integer)
för task 2, kommer att innehålla antal museer i Bukarest (värde av typ integer)
för task 3, kommer att innehålla antal kolumner som innehåller minst ett saknat värde (NaN) (värde av typ integer)
för task 4, kommer att innehålla året då flest museer grundades (värde av typ integer)
för task 5, kommer att innehålla antal museer i varje län (värde av typ integer, en rad för varje län)
för task 6, kommer att innehålla procent av ifyllda fält för varje museum, beräknat som:
(antal ifyllda fält / totalt antal kolumner) × 100(värde av typ float, rekommenderat avrundat till 2 decimaler)
för task 7, kommer att innehålla medelvärdet av fullständighetspoängen för hela datasetet (värde av typ float, rekommenderat avrundat till 2 decimaler)
för task 8, kommer att innehålla procent av museer som har maximal fullständighetspoäng (värde av typ float, rekommenderat avrundat till 2 decimaler)