Тежина
Твој најбољи резултат
Н/Д
Ključni korak u procesu digitalizacije kulturnog nasleđa predstavlja prikupljanje, strukturiranje i objavljivanje podataka. Bez realnih, koherentnih i dostupnih podataka, bilo koja analiza ili digitalna aplikacija bi ostala na čisto teoretskom nivou.
Nacionalni institut za nasleđe direktno doprinosi ovom procesu objavljivanjem skupova otvorenih podataka na vladinoj platformi data.gov.ro, pružajući javni pristup zvaničnim informacijama o kulturnim institucijama u Rumuniji. Među njima se nalazi i skup podataka koji se odnosi na muzeje u Rumuniji, koji sadrži informacije poput naziva muzeja, administrativne lokacije, godine osnivanja, geografskih koordinata i opisnih podataka.
U okviru ovog problema treba da realizujete eksploratornu analizu za ovaj skup podataka.
Skup podataka je dat u CSV formatu (Comma-Separated Values) i sadrži informacije o muzejima u Rumuniji, nastale konverzijom iz JSON formata objavljenog na platformi data.gov.ro.
Svaki red u CSV fajlu odgovara jednom muzeju, a svaka kolona opisuje određeni atribut tog muzeja.
Skup podataka sadrži, između ostalog, sledeće kolone:
_id – interni identifikator zapisajudețul – okrug u kome se nalazi muzejdenumirea (română) – naziv muzeja na rumunskom jezikulocalitatea – mesto u kome se nalazi muzejanul înființării – godina kada je muzej osnovancategoria (română) – kategorija muzejalatitudine – geografska koordinata latitudelongitudine – geografska koordinata longitudedescrierea (română) – tekstualni opis muzejaURL – veb sajt muzeja (ako je dostupan)Nedostajuće vrednosti su označene praznim poljima.
Odredite ukupan broj muzeja u skupu podataka.
Odredite broj muzeja za koje u koloni județul nalazimo vrednost București.
Odredite broj kolona koje sadrže najmanje jednu nedostajuću vrednost (NaN).
Odredite godinu u kojoj je osnovano najviše muzeja, na osnovu informacija koje imamo specificirane u koloni anul înființării.
Odredite za svaki okrug koji se pojavljuje u ovom skupu podataka, koliko muzeja postoji u tom okrugu.
Za svaki muzej, izračunajte procenat popunjenih kolona (non-NaN) od ukupnog broja kolona. Računanje ovog skora se vrši koristeći sledeću formulu:

Odredite prosek skora kompletnosti za ceo skup podataka. Za ovo ćemo sabrati skorove dobijene u zahtevu 6 i podeliti ukupan zbir brojem muzeja.
Odredite procenat muzeja koji imaju maksimalni skor kompletnosti. Definišemo maksimalni skor kompletnosti kao maksimalnu vrednost među onima određenim u task-u 6.
Za automatsko ocenjivanje treba da učitate fajl u csv formatu sa sledećom strukturom:
id – identifikator reda (odgovarajući onom iz test.csv)
ididididid_id iz skupa podataka)ididsubtaskID – identifikator zahteva:
1 za ukupan broj zapisa (task 1)2 za broj muzeja iz Bukurešta (task 2)3 za broj kolona sa nedostajućim vrednostima (task 3)4 za godinu sa najviše muzeja (task 4)5 za distribuciju muzeja po okruzima (task 5)6 za procenat popunjenih vrednosti (task 6)7 za prosek skora kompletnosti (task 7)8 za muzeje sa maksimalnom kompletnošću (task 8)answer – odgovor odgovarajući svakom task-u
za task 1, sadržaće ukupan broj muzeja u skupu podataka (vrednost tipa integer)
za task 2, sadržaće broj muzeja iz Bukurešta (vrednost tipa integer)
za task 3, sadržaće broj kolona koje sadrže najmanje jednu nedostajuću vrednost (NaN) (vrednost tipa integer)
za task 4, sadržaće godinu u kojoj je osnovano najviše muzeja (vrednost tipa integer)
za task 5, sadržaće broj muzeja iz svakog okruga (vrednost tipa integer, po jedan red za svaki okrug)
za task 6, sadržaće procenat popunjenih polja za svaki muzej, izračunat kao:
(broj popunjenih polja / ukupan broj kolona) × 100(vrednost tipa float, preporučuje se zaokruživanje na 2 decimale)
za task 7, sadržaće prosek skora kompletnosti za ceo skup podataka (vrednost tipa float, preporučuje se zaokruživanje na 2 decimale)
za task 8, sadržaće procenat muzeja koji imaju maksimalni skor kompletnosti (vrednost tipa float, preporučuje se zaokruživanje na 2 decimale)