Raskusaste
Sinu parim tulemus
Puudub
Oluline samm kultuuripärandi digitaliseerimise protsessis on andmete kogumine, struktureerimine ja avaldamine. Ilma reaalsete, sidusate ja kättesaadavate andmeteta jääks iga analüüs või digitaalne rakendus puhtalt teoreetilisele tasemele.
Rahvusliku Pärandi Instituut aitab selle protsessiga otse kaasa, avaldades avatud andmekogumeid valitsuse platvormil data.gov.ro, pakkudes avalikku juurdepääsu ametlikule teabele Rumeenia kultuuriasutuste kohta. Nende hulgas on ka Rumeenia muuseumide andmekogum, mis sisaldab teavet nagu muuseumide nimetused, halduslik asukoht, asutamisaasta, geograafilised koordinaadid ja kirjeldavad andmed.
Selle ülesande raames peate tegema selle andmekogumi jaoks uuriva analüüsi.
Andmekogum on esitatud CSV (Comma-Separated Values) formaadis ja sisaldab teavet Rumeenia muuseumide kohta, mis on saadud platvormil data.gov.ro avaldatud JSON-formaadi teisendamise tulemusel.
Iga rida CSV-failis vastab ühele muuseumile ja iga veerg kirjeldab selle teatud atribuuti.
Andmekogum sisaldab muu hulgas järgmisi veerge:
_id – kirje sisemine identifikaatorjudețul – maakond, kus muuseum asubdenumirea (română) – muuseumi nimi rumeenia keeleslocalitatea – asula, kus muuseum asubanul înființării – aasta, mil muuseum asutaticategoria (română) – muuseumi kategoorialatitudine – geograafiline laiuskraadlongitudine – geograafiline pikkuskraaddescrierea (română) – muuseumi tekstiline kirjeldusURL – muuseumi veebisait (kui saadaval)Puuduvad väärtused on märgitud tühjade väljadega.
Määrake andmekogumis olevate muuseumide koguarv.
Määrake muuseumide arv, mille puhul veerus județul leidub väärtus București.
Määrake veergude arv, mis sisaldavad vähemalt ühte puuduvat väärtust (NaN).
Määrake aasta, mil asutati kõige rohkem muuseume, tuginedes veerus anul înființării olemasolevale teabele.
Määrake iga selles andmekogumis esineva maakonna kohta, mitu muuseumi selles maakonnas on.
Arvutage iga muuseumi kohta täidetud (mitte-NaN) veergude protsent kõigist veergudest. Selle skoori arvutamine toimub järgmise valemi abil:

Määrake kogu andmekogumi täielikkuse skoori keskmine. Selleks liidame 6. nõude juures saadud skoorid ja jagame summa muuseumide arvuga.
Määrake maksimaalse täielikkuse skooriga muuseumide protsent. Defineerime maksimaalse täielikkuse skoori kui ülesandes 6 määratud väärtuste suurimat väärtust.
Automaatseks hindamiseks peate üles laadima csv formaadis faili järgmise struktuuriga:
id – rea identifikaator (vastab test.csv omale)
id väärtuseks 1id väärtuseks 2id väärtuseks 3id väärtuseks 4id-na_id andmekogumist)id väärtuseks 7id väärtuseks 8subtaskID – nõude identifikaator:
1 kirjete koguarvu jaoks (ülesanne 1)2 Bukaresti muuseumide arvu jaoks (ülesanne 2)3 puuduvate väärtustega veergude arvu jaoks (ülesanne 3)4 aasta kõige rohkemate muuseumidega jaoks (ülesanne 4)5 muuseumide jaotuse maakondade kaupa jaoks (ülesanne 5)6 täidetud väärtuste protsendi jaoks (ülesanne 6)7 täielikkuse skoori keskmise jaoks (ülesanne 7)8 maksimaalse täielikkusega muuseumide jaoks (ülesanne 8)answer – iga ülesande vastav vastus
ülesande 1 jaoks sisaldab muuseumide koguarvu andmekogumis (integer tüüpi väärtus)
ülesande 2 jaoks sisaldab Bukaresti muuseumide arvu (integer tüüpi väärtus)
ülesande 3 jaoks sisaldab veergude arvu, mis sisaldavad vähemalt ühte puuduvat väärtust (NaN) (integer tüüpi väärtus)
ülesande 4 jaoks sisaldab aastat, mil asutati kõige rohkem muuseume (integer tüüpi väärtus)
ülesande 5 jaoks sisaldab muuseumide arvu igas maakonnas (integer tüüpi väärtus, üks rida iga maakonna kohta)
ülesande 6 jaoks sisaldab täidetud väljade protsenti iga muuseumi kohta, arvutatuna kui:
(täidetud väljade arv / veergude koguarv) × 100(float tüüpi väärtus, soovitatavalt ümardatud 2 kümnendkohani)
ülesande 7 jaoks sisaldab kogu andmekogumi täielikkuse skoori keskmist (float tüüpi väärtus, soovitatavalt ümardatud 2 kümnendkohani)
ülesande 8 jaoks sisaldab maksimaalse täielikkuse skooriga muuseumide protsenti (float tüüpi väärtus, soovitatavalt ümardatud 2 kümnendkohani)