Dificuldade
A tua melhor pontuação
N/D
Um passo essencial no processo de digitalização do patrimônio cultural é representado pela coleta, estruturação e publicação de dados. Sem dados reais, coerentes e acessíveis, qualquer análise ou aplicação digital permaneceria em nível puramente teórico.
O Instituto Nacional do Patrimônio contribui diretamente para este processo através da publicação de conjuntos de dados abertos na plataforma governamental data.gov.ro, oferecendo acesso público a informações oficiais sobre as instituições de cultura da Romênia. Entre estes encontra-se também o dataset referente aos museus da Romênia, que contém informações como denominação dos museus, localização administrativa, ano de fundação, coordenadas geográficas e dados descritivos.
No âmbito deste problema vocês terão que realizar uma análise exploratória para este conjunto de dados.
O conjunto de dados é fornecido em formato CSV (Comma-Separated Values) e contém informações sobre os museus da Romênia, resultantes da conversão de um formato JSON publicado na plataforma data.gov.ro.
Cada linha do arquivo CSV corresponde a um museu, e cada coluna descreve um determinado atributo do mesmo.
O conjunto de dados contém, entre outros, as seguintes colunas:
_id – identificador interno do registrojudețul – distrito onde está localizado o museudenumirea (română) – nome do museu em língua romenalocalitatea – localidade onde se encontra o museuanul înființării – ano em que foi fundado o museucategoria (română) – categoria do museulatitudine – coordenada geográfica de latitudelongitudine – coordenada geográfica de longitudedescrierea (română) – descrição textual do museuURL – site web do museu (se disponível)Os valores ausentes são marcados através de campos vazios.
Determine o número total de museus no dataset.
Determine o número de museus para os quais na coluna județul encontramos o valor București.
Determine o número de colunas que contêm pelo menos um valor ausente (NaN).
Determine o ano em que foram fundados mais museus, com base nas informações que temos especificadas na coluna anul înființării.
Determine para cada distrito, que aparece neste conjunto de dados, quantos museus existem naquele distrito.
Para cada museu, calcule o percentual de colunas preenchidas (non-NaN) do total de colunas. O cálculo deste score é realizado utilizando a seguinte fórmula:

Determine a média do score de completude para todo o dataset. Para isso, somaremos os scores obtidos no requisito 6 e dividiremos o total pelo número de museus.
Determine o percentual de museus que têm o score de completude máximo. Definimos o score de completude máximo como o valor máximo entre os determinados no task 6.
Para a avaliação automática deve carregar um arquivo em formato csv com a seguinte estrutura:
id – identificador da linha (correspondente ao de test.csv)
ididididid_id do conjunto de dados)ididsubtaskID – identificador do requisito:
1 para número total de registros (task 1)2 para número de museus de Bucareste (task 2)3 para número de colunas com valores ausentes (task 3)4 para ano com mais museus (task 4)5 para distribuição dos museus por distritos (task 5)6 para percentual de valores preenchidos (task 6)7 para média do score de completude (task 7)8 para museus com completude máxima (task 8)answer – resposta correspondente a cada task
para o task 1, conterá o número total de museus no dataset (valor do tipo integer)
para o task 2, conterá o número de museus de Bucareste (valor do tipo integer)
para o task 3, conterá o número de colunas que contêm pelo menos um valor ausente (NaN) (valor do tipo integer)
para o task 4, conterá o ano em que foram fundados mais museus (valor do tipo integer)
para o task 5, conterá o número de museus de cada distrito (valor do tipo integer, uma linha para cada distrito)
para o task 6, conterá o percentual de campos preenchidos para cada museu, calculado como:
(número campos preenchidos / número total colunas) × 100(valor do tipo float, recomendado arredondado a 2 casas decimais)
para o task 7, conterá a média do score de completude para todo o dataset (valor do tipo float, recomendado arredondado a 2 casas decimais)
para o task 8, conterá o percentual de museus que têm o score de completude máximo (valor do tipo float, recomendado arredondado a 2 casas decimais)