Trudność
Twój najlepszy wynik
Nie dotyczy
Kluczowym krokiem w procesie cyfryzacji dziedzictwa kulturowego jest zbieranie, strukturyzowanie i publikowanie danych. Bez rzeczywistych, spójnych i dostępnych danych, każda analiza lub aplikacja cyfrowa pozostałaby na poziomie czysto teoretycznym.
Narodowy Instytut Dziedzictwa przyczynia się bezpośrednio do tego procesu poprzez publikowanie otwartych zestawów danych na rządowej platformie data.gov.ro, oferując publiczny dostęp do oficjalnych informacji o instytucjach kultury w Rumunii. Wśród nich znajduje się również zestaw danych dotyczący muzeów w Rumunii, który zawiera informacje takie jak nazwy muzeów, lokalizacja administracyjna, rok założenia, współrzędne geograficzne i dane opisowe.
W ramach tego problemu będziecie mieli do wykonania analizę eksploracyjną tego zestawu danych.
Zestaw danych jest dostarczany w formacie CSV (Comma-Separated Values) i zawiera informacje o muzeach w Rumunii, będące wynikiem konwersji z formatu JSON opublikowanego na platformie data.gov.ro.
Każdy wiersz w pliku CSV odpowiada jednemu muzeum, a każda kolumna opisuje określony atrybut tego muzeum.
Zestaw danych zawiera między innymi następujące kolumny:
_id – wewnętrzny identyfikator rekordujudețul – województwo, w którym znajduje się muzeumdenumirea (română) – nazwa muzeum w języku rumuńskimlocalitatea – miejscowość, w której znajduje się muzeumanul înființării – rok założenia muzeumcategoria (română) – kategoria muzeumlatitudine – współrzędna geograficzna szerokościlongitudine – współrzędna geograficzna długościdescrierea (română) – opis tekstowy muzeumURL – strona internetowa muzeum (jeśli jest dostępna)Brakujące wartości są oznaczone pustymi polami.
Określ całkowitą liczbę muzeów w zestawie danych.
Określ liczbę muzeów, dla których w kolumnie județul znajdujemy wartość București.
Określ liczbę kolumn, które zawierają co najmniej jedną brakującą wartość (NaN).
Określ rok, w którym założono najwięcej muzeów, na podstawie informacji, które mamy określone w kolumnie anul înființării.
Określ dla każdego województwa, które pojawia się w tym zestawie danych, ile muzeów istnieje w tym województwie.
Dla każdego muzeum oblicz procent wypełnionych kolumn (non-NaN) z całkowitej liczby kolumn. Obliczenie tego wyniku jest realizowane przy użyciu następującej formuły:

Określ średnią wyniku kompletności dla całego zestawu danych. W tym celu zsumujemy wyniki uzyskane w wymaganiu 6 i podzielimy sumę przez liczbę muzeów.
Określ procent muzeów, które mają maksymalny wynik kompletności. Definiujemy maksymalny wynik kompletności jako wartość maksymalną spośród tych określonych w zadaniu 6.
Do automatycznej oceny należy przesłać plik w formacie csv o następującej strukturze:
id – identyfikator wiersza (odpowiadający temu z test.csv)
ididididid_id z zestawu danych)ididsubtaskID – identyfikator wymagania:
1 dla całkowitej liczby rekordów (zadanie 1)2 dla liczby muzeów w Bukareszcie (zadanie 2)3 dla liczby kolumn z brakującymi wartościami (zadanie 3)4 dla roku z największą liczbą muzeów (zadanie 4)5 dla rozkładu muzeów według województw (zadanie 5)6 dla procentu wypełnionych wartości (zadanie 6)7 dla średniej wyniku kompletności (zadanie 7)8 dla muzeów z maksymalną kompletnością (zadanie 8)answer – odpowiedź odpowiadająca każdemu zadaniu
dla zadania 1, będzie zawierać całkowitą liczbę muzeów w zestawie danych (wartość typu integer)
dla zadania 2, będzie zawierać liczbę muzeów w Bukareszcie (wartość typu integer)
dla zadania 3, będzie zawierać liczbę kolumn, które zawierają co najmniej jedną brakującą wartość (NaN) (wartość typu integer)
dla zadania 4, będzie zawierać rok, w którym założono najwięcej muzeów (wartość typu integer)
dla zadania 5, będzie zawierać liczbę muzeów w każdym województwie (wartość typu integer, po jednym wierszu dla każdego województwa)
dla zadania 6, będzie zawierać procent wypełnionych pól dla każdego muzeum, obliczony jako:
(liczba wypełnionych pól / całkowita liczba kolumn) × 100(wartość typu float, zalecane zaokrąglenie do 2 miejsc po przecinku)
dla zadania 7, będzie zawierać średnią wyniku kompletności dla całego zestawu danych (wartość typu float, zalecane zaokrąglenie do 2 miejsc po przecinku)
dla zadania 8, będzie zawierać procent muzeów, które mają maksymalny wynik kompletności (wartość typu float, zalecane zaokrąglenie do 2 miejsc po przecinku)