Тежина
Твој најбољи резултат
Н/Д
Ključni korak u procesu digitalizacije kulturnog nasleđa predstavlja prikupljanje, strukturiranje i objavljivanje podataka. Bez realnih, koherentnih i dostupnih podataka, bilo koja analiza ili digitalna aplikacija bi ostala na čisto teoretskom nivou.
Nacionalni institut za nasleđe direktno doprinosi ovom procesu objavljivanjem setova otvorenih podataka na vladinoj platformi data.gov.ro, pružajući javni pristup zvaničnim informacijama o kulturnim institucijama u Rumuniji. Među njima se nalazi i dataset koji se odnosi na muzeje u Rumuniji, koji sadrži informacije poput naziva muzeja, administrativne lokacije, godine osnivanja, geografskih koordinata i opisnih podataka.
U okviru ovog problema ćete imati zadatak da realizujete eksplorativnu analizu za ovaj set podataka.
Set podataka je dat u CSV formatu (Comma-Separated Values) i sadrži informacije o muzejima u Rumuniji, nastale konverzijom iz JSON formata objavljenog na platformi data.gov.ro.
Svaki red u CSV fajlu odgovara jednom muzeju, a svaka kolona opisuje određeni atribut tog muzeja.
Set podataka sadrži, između ostalog, sledeće kolone:
_id – interni identifikator zapisajudețul – okrug u kome se nalazi muzejdenumirea (română) – naziv muzeja na rumunskom jezikulocalitatea – mesto u kome se nalazi muzejanul înființării – godina osnivanja muzejacategoria (română) – kategorija muzejalatitudine – geografska koordinata latitudelongitudine – geografska koordinata longitudedescrierea (română) – tekstualni opis muzejaURL – web sajt muzeja (ako je dostupan)Nedostajuće vrednosti su označene praznim poljima.
Odredite ukupan broj muzeja u datasetu.
Odredite broj muzeja za koje u koloni județul nalazimo vrednost București.
Odredite broj kolona koje sadrže najmanje jednu nedostajuću vrednost (NaN).
Odredite godinu u kojoj je osnovano najviše muzeja, na osnovu informacija koje imamo specificirane u koloni anul înființării.
Odredite za svaki okrug koji se pojavljuje u ovom setu podataka, koliko muzeja postoji u tom okrugu.
Za svaki muzej, izračunajte procenat popunjenih kolona (non-NaN) od ukupnog broja kolona. Izračunavanje ovog skora se vrši koristeći sledeću formulu:

Odredite prosek skora kompletnosti za ceo dataset. Za ovo ćemo sabrati skorove dobijene u zahtevu 6 i podeliti ukupan broj sa brojem muzeja.
Odredite procenat muzeja koji imaju maksimalan skor kompletnosti. Definišemo maksimalan skor kompletnosti kao maksimalnu vrednost među onima određenim u task-u 6.
Za automatsko ocenjivanje treba da učitate fajl u csv formatu sa sledećom strukturom:
id – identifikator reda (odgovarajući onom iz test.csv)
ididididid_id iz seta podataka)ididsubtaskID – identifikator zahteva:
1 za ukupan broj zapisa (task 1)2 za broj muzeja iz Bukurešta (task 2)3 za broj kolona sa nedostajućim vrednostima (task 3)4 za godinu sa najviše muzeja (task 4)5 za distribuciju muzeja po okruzima (task 5)6 za procenat popunjenih vrednosti (task 6)7 za prosek skora kompletnosti (task 7)8 za muzeje sa maksimalnom kompletnošću (task 8)answer – odgovor koji odgovara svakom task-u
za task 1, sadržaće ukupan broj muzeja u datasetu (vrednost tipa integer)
za task 2, sadržaće broj muzeja iz Bukurešta (vrednost tipa integer)
za task 3, sadržaće broj kolona koje sadrže najmanje jednu nedostajuću vrednost (NaN) (vrednost tipa integer)
za task 4, sadržaće godinu u kojoj je osnovano najviše muzeja (vrednost tipa integer)
za task 5, sadržaće broj muzeja iz svakog okruga (vrednost tipa integer, po jedan red za svaki okrug)
za task 6, sadržaće procenat popunjenih polja za svaki muzej, izračunat kao:
(broj popunjenih polja / ukupan broj kolona) × 100(vrednost tipa float, preporučeno zaokruženo na 2 decimale)
za task 7, sadržaće prosek skora kompletnosti za ceo dataset (vrednost tipa float, preporučeno zaokruženo na 2 decimale)
za task 8, sadržaće procenat muzeja koji imaju maksimalan skor kompletnosti (vrednost tipa float, preporučeno zaokruženo na 2 decimale)