Trudność
Twój najlepszy wynik
Nie dotyczy
Istotnym krokiem w procesie digitalizacji dziedzictwa kulturowego jest gromadzenie, strukturyzowanie i publikowanie danych. Bez rzeczywistych, spójnych i dostępnych danych, każda analiza lub aplikacja cyfrowa pozostałaby na poziomie czysto teoretycznym.
Narodowy Instytut Dziedzictwa przyczynia się bezpośrednio do tego procesu poprzez publikowanie otwartych zestawów danych na rządowej platformie data.gov.ro, oferując publiczny dostęp do oficjalnych informacji o instytucjach kultury w Rumunii. Wśród nich znajduje się również zestaw danych dotyczący muzeów w Rumunii, który zawiera informacje takie jak nazwy muzeów, lokalizacja administracyjna, rok założenia, współrzędne geograficzne i dane opisowe.
W ramach tego zadania będziecie musieli przeprowadzić analizę eksploracyjną dla tego zestawu danych.
Zestaw danych jest dostarczany w formacie CSV (Comma-Separated Values) i zawiera informacje o muzeach w Rumunii, będące wynikiem konwersji z formatu JSON opublikowanego na platformie data.gov.ro.
Każdy wiersz w pliku CSV odpowiada jednemu muzeum, a każda kolumna opisuje określony atrybut tego muzeum.
Zestaw danych zawiera między innymi następujące kolumny:
_id – wewnętrzny identyfikator rekordujudețul – województwo, w którym znajduje się muzeumdenumirea (română) – nazwa muzeum w języku rumuńskimlocalitatea – miejscowość, w której znajduje się muzeumanul înființării – rok założenia muzeumcategoria (română) – kategoria muzeumlatitudine – współrzędna geograficzna szerokościlongitudine – współrzędna geograficzna długościdescrierea (română) – opis tekstowy muzeumURL – strona internetowa muzeum (jeśli jest dostępna)Brakujące wartości są oznaczone pustymi polami.
Określcie całkowitą liczbę muzeów w zestawie danych.
Określcie liczbę muzeów, dla których w kolumnie județul znajdujemy wartość București.
Określcie liczbę kolumn, które zawierają co najmniej jedną brakującą wartość (NaN).
Określcie rok, w którym założono najwięcej muzeów, na podstawie informacji, które mamy określone w kolumnie anul înființării.
Określcie dla każdego województwa, które pojawia się w tym zestawie danych, ile muzeów istnieje w tym województwie.
Dla każdego muzeum obliczcie procent wypełnionych kolumn (non-NaN) z całkowitej liczby kolumn. Obliczenie tego wyniku jest realizowane przy użyciu następującej formuły:

Określcie średnią wyniku kompletności dla całego zestawu danych. W tym celu zsumujemy wyniki otrzymane w wymaganiu 6 i podzielimy sumę przez liczbę muzeów.
Określcie procent muzeów, które mają maksymalny wynik kompletności. Definiujemy maksymalny wynik kompletności jako wartość maksymalną spośród tych określonych w zadaniu 6.
Do automatycznej oceny musicie przesłać plik w formacie csv o następującej strukturze:
id – identyfikator wiersza (odpowiadający temu z test.csv)
ididididid_id z zestawu danych)ididsubtaskID – identyfikator wymagania:
1 dla całkowitej liczby rekordów (zadanie 1)2 dla liczby muzeów w Bukareszcie (zadanie 2)3 dla liczby kolumn z brakującymi wartościami (zadanie 3)4 dla roku z największą liczbą muzeów (zadanie 4)5 dla rozkładu muzeów według województw (zadanie 5)6 dla procentu wypełnionych wartości (zadanie 6)7 dla średniej wyniku kompletności (zadanie 7)8 dla muzeów z maksymalną kompletnością (zadanie 8)answer – odpowiedź odpowiadająca każdemu zadaniu
dla zadania 1, będzie zawierać całkowitą liczbę muzeów w zestawie danych (wartość typu integer)
dla zadania 2, będzie zawierać liczbę muzeów w Bukareszcie (wartość typu integer)
dla zadania 3, będzie zawierać liczbę kolumn, które zawierają co najmniej jedną brakującą wartość (NaN) (wartość typu integer)
dla zadania 4, będzie zawierać rok, w którym założono najwięcej muzeów (wartość typu integer)
dla zadania 5, będzie zawierać liczbę muzeów w każdym województwie (wartość typu integer, po jednym wierszu dla każdego województwa)
dla zadania 6, będzie zawierać procent wypełnionych pól dla każdego muzeum, obliczony jako:
(liczba wypełnionych pól / całkowita liczba kolumn) × 100(wartość typu float, zalecane zaokrąglenie do 2 miejsc po przecinku)
dla zadania 7, będzie zawierać średnią wyniku kompletności dla całego zestawu danych (wartość typu float, zalecane zaokrąglenie do 2 miejsc po przecinku)
dla zadania 8, będzie zawierać procent muzeów, które mają maksymalny wynik kompletności (wartość typu float, zalecane zaokrąglenie do 2 miejsc po przecinku)