

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
O HDFS do Apache Hadoop permite o armazenamento distribuído e tolerante a falhas de grandes volumes de dados não estruturados, sendo adequado, no que concerne às atividades da INFRA S.A., para dados históricos de sensores e registros de campo, por exemplo.
Certo
Errado
Hadoop é um framework de código aberto baseado em um modelo distribuído que permite o processamento e o armazenamento de grandes volumes de dados de maneira escalável. Dentro desse framework, uma das principais abordagens para o processamento de dados envolve a divisão do processamento em duas etapas: na primeira, os dados são divididos em pequenos blocos e distribuídos para os nós do cluster; na segunda, os dados processados são agregados. Diante de tal informação, assinale a alternativa que apresenta uma das partes do Hadoop que implementa esse modelo de processamento de dados.
FinalCompressor.
Spark Streaming.
Resilient Distributed Datasets (RDDs).
MapReduce.
HDFS (Hadoop Distributed File System).
O Hadoop é uma estrutura de software de código aberto amplamente utilizada para processamento de grandes volumes de dados. Ele usa um modelo de programação e framework para implantar processamento distribuído de grandes volumes de dados no disco, conhecido como:
HBase.
HDFS.
YARN.
Spark.
MapReduce.
A área do Big Data destaca muitas oportunidades potenciais ao revisitar os conjuntos de dados coletados ou arquivados, tendo em vista o desenvolvimento de vários frameworks como Hadoop e Apache Spark. A respeito do Hadoop, é correto afirmar que
a principal vantagem do Hadoop é processar a carga de trabalho em lotes, permitindo lidar com dados em streaming e interativos.
baseia-se em uma arquitetura de computação distribuída e utiliza o Hadoop Distributed File System para armazenamento de dados e Map Reduce para processamento paralelo.
a principal vantagem do Hadoop é processar a carga de trabalho em lotes, permitindo lidar com dados em streaming e interativos, usando Resilient Distributed Datasets na memória RAM.
baseia-se em uma arquitetura de computação distribuída e utiliza o Hadoop Distributed File System para armazenamento de dados e Resilient Distributed Datasets para processamento paralelo.
a principal vantagem do Hadoop está na utilização da arquitetura Kappa, tornando-o, desta forma, mais eficiente que o Apache Spark, no processamento de dados streaming.
Uma empresa precisa processar grandes volumes de dados e está avaliando a adoção de Apache Hadoop ou Apache Spark para suas operações. A equipe técnica analisou as características de cada tecnologia e fez as seguintes observações:
• A equipe deseja minimizar a latência no processamento dos dados.
• O projeto exige suporte para análise de dados em tempo real.
• O orçamento disponível permite a utilização de mais memória RAM, se necessário.
• A infraestrutura já possui um Data Lake armazenado no HDFS.
Com base nas informações apresentadas, assinale a alternativa que representa a escolha mais adequada e o seu principal motivo.
O Hadoop é a melhor escolha, pois seu modelo baseado em MapReduce, permite o processamento em memória, reduzindo a latência.
O Hadoop é a melhor escolha, pois é mais eficiente para análises interativas e streaming de dados.
O Spark não pode ser usado nesse cenário, pois exige um sistema de arquivos próprio e não suporta HDFS.
O Spark é a melhor escolha, pois oferece processamento em tempo real por meio do módulo Spark Streaming e pode usar HDFS como fonte de dados.
O Hadoop e o Spark são equivalentes para esse caso, pois ambos possuem processamento em tempo real e baixa latência.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
O Hadoop é um ecossistema para processamento distribuído de grandes volumes de dados, estruturados ou não. Sua arquitetura central é composta por módulos complementares. Considerando essas informações, assinale a opção em que são corretamente apresentados os três principais componentes do Hadoop.
HDFS para armazenamento, MapReduce para consultas OLAP e Sqoop para integração com sistemas de gerenciamento de bancos de dados (SGBDs)
HDFS para armazenamento, Spark para processamento e Hive para consultas SQL
HDFS para armazenamento, MapReduce para processamento e YARN para gerenciamento de recursos
Cassandra para armazenamento, MapReduce para processamento e YARN para consultas
HDFS para armazenamento, Tez para processamento e Zookeeper para gerenciamento de recursos
O modelo MapReduce possibilita o processamento, de modo paralelo, de grandes volumes de dados, de modo que se divida a carga de trabalho entre os diversos nós do cluster.
Certo
Errado
Acerca da arquitetura de sistemas analíticos e do ecossistema Apache Hadoop, julgue os próximos itens.
O Hadoop é considerado ineficiente em cenários que exigem escalabilidade horizontal, sendo mais adequado para processamento em clusters pequenos.
Certo
Errado
O Apache Hadoop é um framework de código aberto usado para armazenar e processar com eficiência grandes conjuntos de dados que variam em tamanho de gigabytes a petabytes. No que tange à sua constituição, o Apache Hadoop apresenta quatro módulos: HDFS (Hadoop Distributed File System), YARN (Yet Another Resource Negotiator ), MapReduce e Hadoop Common. Os módulos YARN e MapReduce oferecem, respectivamente,
sistema otimizado para transferência de dados e plataforma de gerenciamento de recursos.
sistema de arquivos distribuídos e plataforma de gerenciamento de clusters.
modelo de computação paralela e sistema de arquivos distribuídos.
plataforma de gerenciamento de clusters e processamento paralelo/ distribuído.
O núcleo do Hadoop File System é um servidor executado em uma máquina chamada NameNode, que recebe e coordena todas as solicitações do sistema de arquivos.
Certo
Errado


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
O ecossistema Hadoop se refere aos vários componentes da biblioteca de software Apache Hadoop, incluindo projetos de código aberto e ferramentas complementares para armazenar e processar Big Data. Algumas das ferramentas mais conhecidas incluem HDFS, Pig, YARN, MapReduce, Spark, HBase Oozie, Sqoop e Kafka, cada uma com função específica no ecossistema Hadoop. São funções dos componentes do ecossistema Hadoop:
HDFS gerencia o armazenamento e o MapReduce gerencia o processamento de dados.
Spark é uma ferramenta para o armazenamento, desenvolvido para substituir o HDFS.
Kafka é uma ferramenta para processamento de dados distribuídos, em substituição ao processamento em lote.
HDFS gerencia o processamento e o MapReduce gerencia o armazenamento de dados.
Um framework para processamento distribuído de big data, de código aberto, amplamente utilizado para o processamento distribuído de grandes conjuntos de dados, é conhecido como
Hadoop.
BILake.
Skyway.
HashDrive.
MachineLake.
MapReduce é um modelo de programação amplamente utilizado em Big Data para processar e analisar grandes conjuntos de dados de maneira distribuída. Desta forma, assinale a opção que apresenta o sistema MapReduce mais utilizado de acordo com Grus (2016).
Apache Flink.
Apache Hive.
Apache Torncat.
Hadoop.
MongoDB.
O Apache Hadoop é um framework de software de código aberto projetado para processamento distribuído de grandes conjuntos de dados. Qual componente é responsável pelo armazenamento distribuído de dados no Apache Hadoop?
MapReduce.
Apache Spark.
Apache Hive.
Hadoop Distributed File System.
O Hadoop MapReduce permite que os arquivos de entrada e saída sejam armazenados em um sistema de arquivos distribuído, de modo que várias máquinas leiam e gravem dados em paralelo.
Certo
Errado


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Uma das desvantagens do sistema de arquivos distribuído Hadoop File System é a impossibilidade de conectá-lo ao sistema de arquivos local de uma máquina.
Certo
Errado
Um empreendimento de alta tecnologia pretende trabalhar com o framework Hadoop para o armazenamento e processamento de dados em larga escala. Pretende-se configurar o Sistema de Arquivos Distribuídos do Hadoop (HDFS), de modo que ele atue como um sistema de arquivos bem distribuídos, atuando na camada de armazenamento do Hadoop.
A configuração adequada para esse sistema HDFS ser mais tolerante a falhas é aquela na qual o sistema se encarrega de
criar um diretório no cluster master, para servir de apoio aos dados de armazenamento temporário do sistema distribuído, formando um bloco de arquivos de 64MB associado às aplicações dos clientes, com cada bloco manipulado pelo HDFS.
designar as estruturas de dados como nós, associados às funções de monitoração e execução de dados, pretendendo, com isso, checar falhas de acesso aos nós e permitir o reacesso a um nó perdido.
estruturar os dados recebidos em blocos de 64 MB, de forma a estabelecer uma coleção de pares com a chave de identificação e o valor, que é o dado propriamente dito, sendo a manipulação realizada por funções construídas com linguagens específicas.
particionar os arquivos em blocos de 64 MB e replicar os blocos em três cópias no modo cluster e uma cópia no modo local, alocando os mesmos em servidores diferentes.
providenciar, para cada estrutura de dados, uma conexão ao nó ao qual ela está ligada por meio de um link utilizando o protocolo SSH, de modo a manter uma estrutura básica master-slave entre os nós do sistema distribuído de dados, facilitando a localização dos dados no cluster.
Projetos de Big Data, quando necessário, crescem horizontalmente, com a inclusão de novos nodos, e verticalmente, com o acréscimo de mais memória.
Certo
Errado
O Apache Hadoop é uma plataforma amplamente utilizada no processamento de grandes volumes de dados. Ele se destaca por sua arquitetura distribuída e capacidade de lidar com grandes conjuntos de dados de forma eficiente.
Com base nas capacidades e funcionalidades do Hadoop, assinale a opção que = descreve corretamente seu funcionamento e aplicação prática.
O Hadoop é uma plataforma de banco de dados relacional, que utiliza o SQL para gerenciar grandes volumes de dados de maneira centralizada.
O Hadoop possui uma arquitetura distribuída, composta principalmente pelo HDFS (Hadoop Distributed File System) e o MapReduce, permitindo o processamento de grandes volumes de dados de maneira escalável e paralela.
O principal componente do Hadoop é o NoSQL, que possibilita o armazenamento de dados não estruturados em um único servidor, sem a necessidade de distribuição.
O Hadoop foi projetado para pequenas empresas que possuem volumes reduzidos de dados e não requerem processamento paralelo, destacando-se por sua simplicidade de uso.
O Hadoop se limita ao armazenamento de dados em clusters locais, não sendo compatível com ambientes de computação em nuvem ou distribuídos globalmente.
O Hadoop é uma solução para Big Data e foi desenvolvido para armazenar e processar dados em diferentes máquinas com alta velocidade e baixo custo, permitindo a integração de dados por meio da orquestração deles.
Certo
Errado