

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Atualmente existem diversos tipos de bancos de dados NoSQL. Relacione cada tipo de banco NoSQL a seguir com sua descrição.
1. MongoDB
2. Neo4J
3. HBase
4. Redis
( ) Começou como um banco de dados orientados a grafos e evoluiu para um rico ecossistema com inúmeras ferramentas de apoio. Utiliza a Cypher como sua linguagem de consultas.
( ) Banco de dados multiplataforma orientado a documentos. Fornece alto desempenho, alta disponibilidade e fácil escalabilidade. Utiliza documentos semelhantes ao JSON como esquema. É publicado sob uma combinação da Licença Pública Geral GNU e Apache.
( ) Banco de código aberto com licença BSD, é capaz de armazenar estrutura de dados na memória. Fornece estruturas de dados como strings, hashes, listas, conjuntos, conjuntos classificados com consultas de intervalo, bitmaps, hiperlogs, índices geoespaciais e fluxos. Possui replicação integrada, script Lua, transações e diferentes níveis de persistência em disco, e fornece alta disponibilidade.
( ) Banco de dados do Hadoop. Capaz de hospedar tabelas muito grandes com bilhões de linhas e milhões de colunas. É um banco de dados não relacional de código aberto, distribuído e modelado a partir do Big Table do Google.
Assinale a opção que indica a relação correta, na ordem apresentada.
1 – 3 – 2 – 4.
4 – 1 – 2 – 3.
1 – 2 – 4 – 2.
3 – 4 – 1 – 2.
2 – 1 – 4 – 3.
No contexto de pré-processamento de dados, o auditor de contas públicas João está trabalhando em um projeto de análise de dados e percebe que as variáveis numéricas no conjunto de dados têm escalas muito diferentes, como a escala dos preços sendo maior do que a escala dos pesos, como demonstrado nos produtos A e B:
∙ Produto A (Preço: R$ 50 e Peso: 300g)
∙ Produto B (Preço: R$ 500 e Peso: 1000g)
Além disso, ele observa a presença de outliers nos dados. Nesse sentido, João deverá tratar os dados para garantir que as variáveis tenham uma distribuição normal, isto é, com média igual a zero e desvio padrão igual a um.
Para isso, a técnica de tratamento de dados que João deverá utilizar, levando em consideração a presença de outliers, é:
discretização (kbins discretization);
codificação (one-hot encoding);
normalização (min-max scaling);
padronização (standardization Z-Score);
transformação logarítmica (log transformation).
Nas últimas décadas, a automatização e a inserção de máquinas agrícolas transformaram profundamente o panorama do trabalho nas áreas rurais [...] e, em menos de 50 anos, a produtividade do agronegócio brasileiro aumentou 400%. [...]
Esses resultados vieram com a adoção da tecnologia nos processos cotidianos, e também com o investimento em pesquisas [...]. Agora, o agronegócio pode estar diante de um novo salto de produtividade; big data e machine learning são ferramentas que estão ganhando espaço e que podem, novamente, transformar o cenário do campo.
Disponível em: https://summitagro.estadao.com.br/tendencias-e-tecnologia/como-big-data-e-machine-learning-sao-aplicados-no-agronegocio/. Acesso em: 5 jan. 2024. Adaptado.
A utilização da plataforma paralela de processamento MapReduce aplica-se adequadamente como um framework de processamento de Big Data, visando à escalabilidade para as aplicações.
Nesse contexto, uma característica inerente à MapReduce é a
sua abordagem, que reflete uma solução simplificada de processamento de dados paralelos em um cluster.
sua função map(), que gera, para cada registro de entrada, um ou mais pares (chave,valor).
sua função reduce(), que gera um resultado combinado em valores que compartilham chaves distintas.
sua demanda pela existência de um esquema de dados.
natureza estática de suas funções, que devem respeitar a especificação original, caracterizando uma restrição inerente a essa abordagem.
A limpeza de dados, data cleansing, é uma tarefa importante que pode ser complexa e demorada, no entanto é um investimento fundamental que pode melhorar a qualidade e a utilidade dos dados para futuras análises.
Seja um conjunto de dados com informações de saúde referentes a uma população. Pode-se limpar esses dados para identificar e tratar valores extremos, discrepantes, contraditórios ou inválidos. Com isso, há maior confiabilidade para estimar a prevalência, a incidência, a mortalidade e os fatores de risco de uma doença naquela população representada por aqueles dados.
Por exemplo, seja o conjunto de dados abaixo referente a uma amostra de 5 indivíduos em uma mesma cidade, na qual um analista percebeu a necessidade de limpeza de dados por conta de potenciais inconsistências.
Indivíduo 1: Sexo: Feminino; Idade: 8 anos; Altura: 1,15m; Peso: 40kg; Batimento Cardíaco em Repouso: 85 bpm
Indivíduo 2: Sexo: Masculino; Idade: 22 anos; Altura: 1,60m; Peso: 60kg; Batimento Cardíaco em Repouso: 72 bpm
Indivíduo 3: Sexo: Feminino; Idade: 40 anos; Altura: 1,60m; Peso: 55kg; Batimento Cardíaco em Repouso: 10 bpm
Indivíduo 4: Sexo: Masculino; Idade: 55 anos; Altura: 1,90m; Peso: 100kg; Batimento Cardíaco em Repouso: 70 bpm
Indivíduo 5: Sexo: Feminino; Idade: 70 anos; Altura: 1,50m; Peso: 60kg; Batimento Cardíaco em Repouso: 70 bpm
Qual ação é a única claramente necessária para realizar data cleansing neste conjunto de dados específico?
Corrigir o valor da altura no indivíduo 1, pois parece anormalmente alto.
Verificar o peso no indivíduo 2, pois nessa idade e altura deveria ser um valor maior.
Confirmar o valor do batimento cardíaco no indivíduo 3, que parece anormalmente baixo.
Alterar o peso no indivíduo 4, pois não condiz com os valores de sexo, idade e altura indicados.
Modificar o valor da altura do indivíduo 5, pois é anormalmente baixo para a idade e sexo.
A ferramenta de projeto utilizada para apoiar a implementação incremental de modelos dimensionais de áreas de negócio distintos compartilhando dimensões padronizadas em um Data Warehouse Corporativo é:
Data Lake.
Pipeline de dados.
Regras de Associação.
Matriz de Barramento.
Na governança de dados, o principal objetivo da implementação de uma política de linhagem de dados é melhorar a velocidade de processamento de dados dentro de uma organização.
Certo
Errado
Em um processo de análise de dados, os shadow systems não representam dados consolidados, por isso devem ser excluídos de todas as fases do projeto.
Certo
Errado
Naive bayes é um algoritmo de machine learning supervisionado que realiza classificação com base no princípio da independência condicional de classe a partir do teorema de Bayes, em que o algoritmo avalia o quanto ele contribuiu para classificar a instância como boa ou ruim, construindo uma tabela de probabilidades.
Certo
Errado
Em data mining, a técnica de associação é uma função que determina o coeficiente de afinidade entre certos eventos.
Certo
Errado
A fase de pré-processamento de dados é um processo semiautomático que depende da capacidade do analista de identificar os problemas presentes nos dados e a natureza desses problemas, bem como os métodos para solucioná-los.
Certo
Errado
A utilização da ingestão de dados para coletar dados de várias fontes e enviá-los para um repositório Big Data pode apresentar alguns desafios como usar os sistemas escaláveis, para lidar com os grandes volumes de dados, garantir que os dados sejam processados em tempo hábil, ter confiabilidade e ser seguro.
Certo
Errado
A tarefa de agrupamento de dados consiste na análise de conjuntos de dados em que estão presentes apenas as descrições dos dados e pode até mesmo resolver problemas de detecção de desvios.
Certo
Errado
A análise de conglomerados tem como objetivo agrupar os elementos de um conjunto de dados que tenham semelhanças entre si.
Certo
Errado
A capacidade de classificação é uma tarefa importante no aprendizado de máquina, por ser utilizada no estabelecimento de padrões.
Certo
Errado
A mudança de uma hierarquia (orientação) dimensional para outra tem sua realização facilitada em um cubo de dados por meio de uma técnica chamada:
roteamento.
pivoteamento.
ROLAP.
MOLAP.
Algoritmos de aprendizado de máquina podem ser supervisionados, não supervisionados ou semi-supervisionados, permitindo que sistemas sejam treinados com ou sem conjuntos de dados rotulados, dependendo do objetivo do modelo.
Certo
Errado
Os sistemas de IA que utilizam aprendizado profundo (deep learning) têm um processo de treinamento rápido e requerem pouco poder computacional, tornando-os ideais para aplicações em tempo real.
Certo
Errado
O conjunto de dados organizados de forma a terem sentido e valor para seu destinatário é conhecido como
estrutura.
informação.
alternativas.
propósito.
conhecimento.
Identificar o tipo de dados ausentes é crucial para se encontrar soluções que os resolvam.
Avalie se os dados ausentes são categorizados como
I. MCAR. Valores ausentes completamente aleatórios.
II. Valores ausentes aleatórios.
III. MICE. Valores ausentes usando imputação múltipla usando equações encadeadas.
Está correto o que se apresenta em
I e II, apenas.
I e III, apenas.
II e III, apenas.
II, apenas.
I, II e III.
Uma arquitetura de Big Data refere-se ao design e à estrutura dos sistemas e tecnologias usadas para coletar, armazenar, processar, analisar e visualizar grandes volumes de dados, frequentemente com grande velocidade e variedade. As arquiteturas de Big Data podem ser projetadas de maneiras diferentes, dependendo das necessidades específicas de processamento e análise.
Em uma arquitetura de Big Data, a camada de processamento
armazena grandes volumes de dados brutos de diversas fontes, aguardando análise futura.
é responsável pela captura e ingestão dos dados em tempo real ou em lotes, organizando-os antes do armazenamento.
transforma e analisa dados, aplicando algoritmos para extrair insights e gerar resultados para outras camadas.
gerencia a segurança e o acesso aos dados, garantindo que apenas usuários autorizados possam manipulá-los.
fornece a interface de visualização de dados, permitindo que os usuários finais interpretem os resultados das análises.