

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Em geral, projetos de Big Data caracterizam-se por cinco diferentes atributos: valor, variedade, velocidade, veracidade e volume.
Certo
Errado
A Assembleia Legislativa gera uma enorme quantidade de dados diariamente, incluindo registros de votação, transcrições de sessões e interações nas redes sociais. O volume desses dados é tão grande, e a velocidade de sua geração tão alta, que as ferramentas tradicionais de banco de dados não são suficientes para processá-los e armazená-los.
No contexto de Big Data, assinale a característica se refere à imensa quantidade de dados gerados, que ultrapassa a capacidade de processamento de sistemas convencionais.
Volume.
Velocity.
Veracity.
Variety.
Value.
Inicialmente, o conceito de Big Data era amplamente descrito pelos chamados ‘3 Vs’. Com o avanço da área, novos ‘Vs’ foram incorporados para ampliar essa definição. Um desses novos ‘Vs’ é a veracidade.
Assinale a opção que melhor define o conceito de veracidade.
A veracidade representa a relevância e utilidade dos dados para uma solução.
A veracidade diz respeito à rapidez com que os dados são coletados, analisados e empregados.
A veracidade está relacionada com a diversidade de formatos, um dado pode ser estruturado ou não estruturado.
A veracidade diz respeito à confiabilidade dos dados, influenciando a precisão dos resultados da análise.
A veracidade está relacionada com a quantidade massiva de dados gerados e armazenados.
Um cientista de dados está explicando o conceito de Big Data em uma conferência e destaca os 5Vs que caracterizam esses conjuntos de dados. Qual das seguintes opções melhor descreve o significado de "Valor" dentro dos 5Vs do Big Data?
A capacidade de armazenar grandes volumes de dados em sistemas de armazenamento.
A diversidade de tipos e fontes de dados, incluindo dados estruturados, semiestruturados e não estruturados.
A rapidez com que os dados são gerados, coletados e processados.
A importância e a utilidade dos dados extraídos, que devem ser convertidos em insights acionáveis para a tomada de decisões.
As informações são a base de toda tomada de decisão e gestão de empresas, sendo um diferencial importante o uso de grandes volumes de dados de diversas fontes.
Nesse contexto, as soluções de Big Data para análise de dados devem ter a capacidade de:
processar dados heterogêneos, de alto volume e alta velocidade, utilizando estruturas computacionais aprimoradas para a automação de processos e tomadas de decisão;
operar dados homogêneos, de alto volume e limitada velocidade, gerando valor agregado para o negócio da empresa;
manusear volumes de dados armazenados localmente, heterogêneos e com atividades semiestruturadas, agregando valor ao processo decisório da empresa;
processar grandes volumes de dados homogêneos, cujo objetivo principal é a implementação de técnicas avançadas de criptografia;
auxiliar no processo de gestão empresarial, processando dados heterogêneos, de alto volume e alta velocidade, descartando domínios de dados e transações.
Como a análise de dados, mais conhecida pelo termo “big data”, pode beneficiar as organizações na era digital?
Aumentando a burocracia interna.
Limitando a capacidade de inovação.
Reduzindo a precisão das decisões estratégicas.
Melhorando a personalização do atendimento ao cliente.
Redução da automação de processos.
Nos últimos anos, houve um crescimento colossal de dados gerados nos ramos de tecnologia da informação (TI), indústrias, saúde, IoT e em outros sistemas envolvendo quase todos os setores da sociedade. Uma estimativa da IBM de 2019 concluiu que 2,5 quintilhões de bytes de dados são criados diariamente. Assinale a alternativa que apresenta qual das fontes de dados contribui para o Big Data.
Dados de documentos físicos
Dados de feedbacks individuais em um pequeno aplicativo
Dados de registros de chamadas em uma pequena empresa
Dados gerados em transações de aplicativos bancários e financeiros
Um data lake é um repositório que pode armazenar grandes volumes de dados e de conjuntos de dados, sejam eles estruturados, semiestruturados ou não estruturados.
Um dos aspectos-chave de um data lake são os seus metadados, que
devem seguir o padrão American National Standards Institute (ANSI) já consagrado para metadados de data lakes
descrevem completa e corretamente todos os dados persistidos.
precisam ser definidos antes da ingestão de dados.
podem ser consultados por meio do “information schema”.
podem ser parcialmente descobertos de forma automática.
Na mineração de dados, a tarefa de classificação consiste em descobrir uma função que mapeie um conjunto de registros de dados em um conjunto de variáveis predefinidas, e as redes neurais e back-propagation são tipos de algoritmos que se aplicam a essa tarefa.
Certo
Errado
A utilização da ingestão de dados para coletar dados de várias fontes e enviá-los para um repositório Big Data pode apresentar alguns desafios como usar os sistemas escaláveis, para lidar com os grandes volumes de dados, garantir que os dados sejam processados em tempo hábil, ter confiabilidade e ser seguro.
Certo
Errado
Assinale a alternativa que apresenta as tecnologias diretamente relacionadas ao armazenamento e processamento de dados no contexto de Big Data.
Hadoop, MongoDB, Apache Spark, Cassandra
Java, Python, Apache Spark, MySQL
MongoDB, MySQL, Kubernetes, Docker
Kafka, TensorFlow, Elasticsearch, Tableau
Em um data lake, os dados são depositados em estado bruto, sem terem passado por qualquer análise e mesmo sem terem uma governança.
Certo
Errado
Uma arquitetura de Big Data refere-se ao design e à estrutura dos sistemas e tecnologias usadas para coletar, armazenar, processar, analisar e visualizar grandes volumes de dados, frequentemente com grande velocidade e variedade. As arquiteturas de Big Data podem ser projetadas de maneiras diferentes, dependendo das necessidades específicas de processamento e análise.
Em uma arquitetura de Big Data, a camada de processamento
armazena grandes volumes de dados brutos de diversas fontes, aguardando análise futura.
é responsável pela captura e ingestão dos dados em tempo real ou em lotes, organizando-os antes do armazenamento.
transforma e analisa dados, aplicando algoritmos para extrair insights e gerar resultados para outras camadas.
gerencia a segurança e o acesso aos dados, garantindo que apenas usuários autorizados possam manipulá-los.
fornece a interface de visualização de dados, permitindo que os usuários finais interpretem os resultados das análises.
“...é um termo que descreve o grande volume de dados, estruturados e não estruturados, que inundam os negócios diariamente. Mas não é a quantidade de dados que é importante. O que importa é o que as organizações fazem com os dados.”
(https://www.questionpro.com/blog/pt-br)
O texto acima está relacionado ao conceito de
Big Data.
Femea.
Hazop.
Roadmap.
Streaming.
Ao considerar os tipos de Big Data - dados estruturados, semiestruturados e não estruturados - e seu impacto nas tecnologias de banco de dados e relação ao armazenamento e processamento desses dados, o que podemos afirmar?
Sistemas de banco de dados relacionais são ótimos para armazenar e processar todos os tipos de Big Data devido à sua flexibilidade inerente.
Dados não estruturados, como imagens e vídeos, são melhor gerenciados por sistemas de arquivos distribuídos, como o Hadoop Distributed File System (HDFS), que oferece escalabilidade e flexibilidade.
Dados semiestruturados, como XML e JSON, são incompatíveis com bancos de dados NoSQL, que são projetados exclusivamente para dados estruturados.
Big Data não tem impacto significativo nas tecnologias de banco de dados existentes, uma vez que técnicas de normalização de dados podem converter qualquer tipo de dado para um formato estruturado.
A empresa de e-commerce Shopping Inteligente está desenvolvendo um sistema de recomendação de produtos para melhorar a experiência do usuário e aumentar as vendas. Para isso, eles precisam armazenar grandes volumes de dados de cliques e visualizações de produtos de maneira eficiente e com alta performance, permitindo até mesmo escalabilidade. Considerando a necessidade de lidar com grandes quantidades de dados em tempo real, qual tecnologia de banco de dados seria mais adequada para esse tipo de aplicação?
Banco de Dados Relacional (RDBMS): Utilizar um banco de dados relacional tradicional como MySQL ou PostgreSQL, conhecido por sua robustez e conformidade com ACID, para armazenar e consultar os dados de cliques e visualizações.
Banco de Dados em Memória (Redis): Usar um banco de dados em memória como Redis, conhecido por sua baixa latência e alto desempenho para operações de leitura e escrita, ideal para dados de sessão e cache.
Banco de Dados NoSQL (Cassandra): Implementar um banco de dados NoSQL como Cassandra, projetado para lidar com grandes volumes de dados distribuídos e oferecer alta disponibilidade e escalabilidade horizontal.
Data Warehouse (Amazon Redshift): Adotar um data warehouse como Amazon Redshift, que permite o armazenamento de grandes volumes de dados históricos e a execução de consultas analíticas complexas com eficiência.
Um data lake funciona como uma arquitetura de armazenamento que requer que todos os dados sejam estruturados e limpos antes de serem armazenados.
Certo
Errado
Uma loja online que está crescendo e coletando muitas informações sobre seus clientes: o que eles clicam, o que compram, as avaliações que deixam nos produtos e até as mensagens que enviam. Para dar dicas de produtos cada vez melhores e deixar a experiência de cada cliente mais personalizada, a loja decidiu criar um "grande depósito de dados" (Data Lake) para guardar tudo isso. E a equipe de especialistas em dados planeja usar Inteligência Artificial e Machine Learning para desvendar os segredos contidos nesse depósito.
Nesse caso, a grande vantagem de usar IA e ML junto com um Data Lake é
acabar de vez com a necessidade de organizar os dados antes de analisá-los.
analisar só as informações antigas, sem se preocupar com o que está acontecendo agora.
usar apenas dados bem organizados em tabelas para treinar os sistemas de IA e ML.
ter a liberdade de usar todos os tipos de dados, mesmo os "crus", para criar análises personalizadas e precisas.
obter resultados super rápidos em análises complicadas, sem precisar checar se os dados estão corretos.
Considerando os ecossistemas de processamento em Big Data, marque V para as afirmativas verdadeiras e F para as falsas.
( ) Hadoop: permite o processamento e o armazenamento de grandes quantidades de dados de forma distribuída.
( ) HBase: componente Hadoop altamente configurável, fornecendo bastante flexibilidade para lidar com enormes quantidades de dados de forma eficiente.
( ) Sqoop: componente que permite a transferência de dados entre o Hadoop e bancos de dados relacionais.
( ) Oozie: serviço de coordenação de alto desempenho para aplicações distribuídas.
A sequência está correta em
V, V, F, V.
F, F, V, F.
V, V, V, F.
F, F, F, V.
A proposta de uma solução de Big Data é oferecer uma abordagem consistente no tratamento do constante crescimento e complexidade dos dados. Os pilares fundamentais para a criação de novas tecnologias e soluções nessa área, conhecidos como 5 V’s do Big Data, são:
variedade, veracidade, volume, velocidade e valor.
viabilidade, veracidade, vazão, volume e valor.
volume, velocidade, visão, veracidade e valor.
verossimilhança, volume, variabilidade, vazão e valor.