

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Os bancos de dados massivos (Big Data) se caracterizam por armazenar grande volume de dados heterogêneos que crescem rapidamente ao longo do tempo.
Para implementar esse tipo de banco de dados, é necessário:
esquema pré-definido;
armazenamento de dados estruturados;
processamento orientado a transações atômicas e isoladas;
infraestrutura computacional escalável;
linguagem de consulta estruturada.
Sobre data lake, é correto afirmar que:
É uma forma de estatística aplicada que incorpora elementos de Ciências da Computação e Matemática para gerar dados quantitativos e qualitativos.
Transforma dados brutos em informações úteis para utilização em rotinas de inteligência de negócio.
É uma solução para tratar, analisar e gerar conhecimento através de grandes conjuntos de dados.
Armazena dados que foram tratados e transformados para uma finalidade específica.
É um repositório centralizado capaz de armazenar grandes volumes de dados em sua forma original.
O Big data é estruturado seguindo os conceitos dos 5 V’s; assinale-os.
Velocidade; Valor; Variedade; Volume; Veracidade.
Validade; Velocidade; Vetor; Variedade; Veracidade.
Volume; Valor; Variabilidade; Veracidade; Viabilidade.
Versatilidade; Valor; Verificação; Visualização; Velocidade.
Para tomar decisões diárias, o analista João precisa consultar o preço de diversas ações do mercado financeiro, bem como outros dados da CVM. Contudo, ao acessar o ambiente de BigData da CVM, João verificou que os preços das ações desse ambiente demoravam para ser atualizados.
João procurou o arquiteto de BigData da CVM para tratar a dimensão da qualidade de dados denominada:
validade (validity);
correspondência (matching);
unicidade (uniqueness);
consistência (consistency);
temporalidade (timeliness).
A propriedade de volume em Big Data refere-se à diversidade de tipos e formatos de dados coletados, analisados e utilizados.
Certo
Errado
Em Big Data, a análise preditiva visa recomendar ações específicas para a identificação de situações em que os resultados da análise podem ser usados para melhorar a eficiência, a eficácia e a produtividade das empresas.
Certo
Errado
Big Data é um conjunto de dados maior e mais complexo de novas fontes de dados que softwares tradicionais de processamento de dados não conseguem gerenciar devido ao seu volume.
Certo
Errado
O Apache Spark é conhecido por sua capacidade de processar grandes volumes de dados de forma eficiente, usando um modelo de processamento paralelo e distribuído. Uma das principais abstrações do Spark é o RDD (Resilient Distributed Dataset). Qual característica dos RDDs contribui diretamente para a eficiência do processamento de dados no Spark?
Sua capacidade de armazenar dados temporariamente em discos magnéticos para evitar a perda de dados durante o processamento.
A imutabilidade dos RDDs, que permite a realização de operações em paralelo de forma segura sem interferências entre as operações.
A habilidade de realizar operações de leitura e escrita em tempo real, otimizando aplicações que exigem atualizações constantes de dados.
Seu mecanismo de indexação automática, que acelera as consultas ao minimizar o tempo necessário para localizar os dados necessários.
O conceito de Big Data engloba não apenas o volume de dados, mas também a variedade e a velocidade com que são produzidos os chamados 3Vs, os principais desafios ou dimensões do Big Data.
Posteriormente, de acordo com o DAMA-DBOK, aos 3Vs iniciais foram adicionados outros 3Vs aos principais desafios ou dimensões do Big Data. São eles:
veracidade, visualização e valor.
valor, validade e visão.
volatilidade, veracidade e validade.
viscosidade, volatilidade e veracidade.
validade, volatilidade e verossimilhança.
Uma das características do Big Data é a sua capacidade de armazenar dados de forma indiscriminada.
Certo
Errado
O principal elemento associado ao Big Data é o registro de qualquer fenômeno, natural ou não, em dados. Tal fenômeno é conhecido como datafication.
Certo
Errado
Arquiteturas de Big Data são responsáveis por lidar com ingestão, processamento e análise de dados grandes ou complexos demais para sistemas de banco de dados tradicionais. Em relação aos componentes das arquiteturas de Big Data, assinale a afirmativa INCORRETA.
Orquestração: Azure Data Factory não é uma tecnologia de orquestração, não permitindo automatizar fluxos de trabalho.
Processamento de fluxo: depois de capturar mensagens em tempo real, a solução precisa processá-las filtrando, agregando e preparando os dados para análise. Os dados de fluxo processados são gravados em um coletor de saída.
Fonte de dados: todas as soluções de Big Data começam com uma ou mais fontes de dados como, por exemplo, armazenamentos de dados de aplicativo, arquivos estáticos produzidos por aplicativos, ou fontes de dados em tempo real.
Processamento em lotes: como os conjuntos de dados são muito grandes, geralmente uma solução de Big Data precisa processar arquivos de dados usando trabalhos em lotes de execução longa para filtrar, agregar e, de outro modo, preparar os dados para análise.
Armazenamento de dados: dados de operações de processamento em lotes normalmente são armazenados em um repositório de arquivos distribuído que pode conter amplos volumes de arquivos grandes em vários formatos. Esse tipo de repositório, geralmente é chamado Data Lake.
As ferramentas utilizadas para manipular dados em Big Data são as mesmas utilizadas em bancos de dados relacionais.
Certo
Errado
Um Data Lake é um repositório de dados que pode armazenar dados em seu formato nativo, seja estruturado, semiestruturado ou não estruturado.
Certo
Errado
Os bancos de dados de Big Data ingerem, preparam e armazenam rapidamente grandes quantidades de dados diversos em um formato que as ferramentas analíticas possam usar.
Certo
Errado
A operação do Data Lake que tem como finalidade permitir importar qualquer quantidade de dados em tempo real de múltiplas fontes é denominada exploração/visualização.
Certo
Errado
Um data lake é um excelente recurso para solucionar problemas e encontrar alternativas no momento da tomada de decisão.
Certo
Errado
Nas aplicações Big Data, a arquitetura paralela e distribuída (Cluster) é o meio para a criação de soluções capazes de analisar grandes bases de dados, processar seus pesados cálculos e disponibilizar serviços especializados para os mais diversos cenários.
Certo
Errado
O TCE SP contratou a empresa DataAnalysis para analisar as características dos candidatos que estão participando do seu concurso. Para realizar o pré-processamento dos dados, a DataAnalysis coletou e classificou as seguintes informações das variáveis relacionadas aos candidatos:
A variável classificada como qualitativa ordinal pela empresa DataAnalysis foi:
Profissão do candidato;
Nome completo do candidato;
Número de anos de experiência profissional;
Idade do candidato, considerando ano e meses;
Nível de escolaridade (Ensino Médio, Graduação, Pós-Graduação).
Uma das etapas que a referida área especializada em dados precisará desenvolver é a de análise exploratória, que consiste em pesquisar formas de criptografar os dados em big data da Internet e em inteligências artificiais abertas.
Certo
Errado