Questões de Concurso sobre O ecossistema do Hadoop

 
 
Disciplina
Assunto 1
Banca
Instituição
Cargo
Ano
Carreira
Área de formação
Escolaridade
Dificuldade
 
Comentários:
Professores
Alunos
Meus Comentários
Vídeo
 
Minhas questões:
Resolvidas
Não resolvidas
Certas
Erradas
 
Tipo de questão:
Certo e errado
Múltipla escolha
Incluir questões:
Anuladas
Desatualizadas
 
Questões:
Todas as questões
 
Filtro simplificado
 
Questões
Todas as questões
 
10 questões encontradas
Questões por página
20
Mais recentes
 

Um Analista de Sistemas, que atua em uma agência de fomento vinculada ao setor governamental, está trabalhando com o Hadoop para processar e analisar grandes volumes de dados armazenados no HDFS (Hadoop Distributed File System). Ele precisa consultar esses dados de forma rápida e eficiente, utilizando uma linguagem semelhante ao SQL (Structured Query Language) para extrair informações agregadas e gerar relatórios. Considerando esse contexto, assinale a alternativa que apresenta duas ferramentas do Hadoop capazes de consultar grandes volumes de dados no HDFS, usando uma linguagem semelhante ao SQL (HiveQL/SQL):


A

Apache Hive e Apache Impala.


B

Data Lake e Apache Flink.


C

Apache Storm e Apache Kafka.


D

Apache Spark e Apache Storm.


E

Apache Flink e Apache Kafka.

Para lidar com o grande volume e a complexidade dos dados do Big Data, foram desenvolvidas tecnologias e frameworks específicos, que superam as limitações dos sistemas de bancos de dados tradicionais. Um analista de dados de um órgão de pesquisa precisa processar um grande conjunto de dados não estruturados.


Analise as seguintes proposições sobre as tecnologias de Big Data:


I. O Hadoop é um framework de código aberto que permite o processamento distribuído de grandes conjuntos de dados em clusters de computadores. Seus componentes principais são o HDFS (Hadoop Distributed File System), para armazenamento distribuído, e o MapReduce, para o processamento paralelo.

II. O MapReduce é um modelo de programação onde a tarefa é dividida em duas fases: a fase 'Map', que processa e mapeia os dados de entrada em pares de chave-valor, e a fase 'Reduce', que agrega os resultados intermediários da fase 'Map' para produzir o resultado final.

III. O Spark é outro framework de processamento distribuído que, embora compatível com o ecossistema Hadoop, é conhecido por ser significativamente mais rápido, pois realiza o processamento em memória (in-memory), sendo ideal para aplicações de aprendizado de máquina e processamento de dados em tempo real.


Está correto o que se afirma em:


A

II e III, apenas.


B

I, apenas.


C

I, II e III.


D

I e II, apenas.


E

II, apenas.

Considere um ambiente fazendário com petabytes de documentos fiscais em cluster, exigindo armazenamento distribuído tolerante a falhas e também execução de análises iterativas com menor leitura repetida em disco. Nesse cenário, a combinação de sistema/framework que atende corretamente às necessidades é


A

Spark SQL para replicação de blocos e HDFS para execução de jobs em memória.


B

Sqoop para armazenamento distribuído e Flume para processamento analítico iterativo.


C

YARN para armazenamento e Hive para processamento iterativo em memória.


D

HBase para armazenamento de arquivos e MapReduce para análises iterativas com cache em memória.


E

HDFS para armazenamento distribuído e Apache Spark para processamento distribuído com uso intensivo de memória.

MapReduce é um modelo de programação utilizado no processamento de grandes volumes de dados. Seu sucesso é decorrente do uso facilitado para processar dados de forma distribuída. Em seu uso, o usuário precisa especificar uma função de Map para gerar os pares de chave/valor. Além disso, torna-se necessário definir a função de Reduce para juntar os valores intermediários processados associados a uma mesma chave. Qual das seguintes ferramentas implementa esse modelo de programação?


A

Apache Hadoop


B

Apache Arrow


C

Spring Boot


D

Scikit-learn

O Apache Hadoop YARN (Yet Another Resource Negotiator) elevou o gerenciamento de recursos e agendamento de tarefas em clusters Hadoop a um novo patamar com sua arquitetura mais flexível e eficiente. Qual dos seguintes benefícios é proporcionado pelo YARN em comparação ao modelo original do Hadoop?


A

Habilita a execução de diversas aplicações de processamento de dados simultaneamente no mesmo cluster Hadoop, otimizando a utilização dos recursos.


B

Simplifica a administração do cluster e o monitoramento de aplicações com uma interface centralizada para gestão de recursos.


C

Aumenta a escalabilidade e a eficiência do cluster ao desacoplar a gestão dos recursos da lógica específica das aplicações de processamento.


D

Minimiza a necessidade de movimentação de dados entre os nós durante o processamento, reduzindo a replicação de dados.

O Hadoop Distributed File System (HDFS) usa uma tabela para rastrear os clusters em um volume de armazenamento; esses clusters se conectam por meio de diretórios e arquivos associados e o HDFS suporta arquivos com tamanhos de volume de até 4 GB.


C

Certo


E

Errado

Os sistemas de Data Warehouse são tradicionalmente suportados por modelos multidimensionais predefinidos, tendo o intuito de prover suporte a aplicações de Business Intelligence. A resposta às novas necessidades é a utilização de memória extensiva, distribuição de dados e paralelização de processamento, que, de uma forma ou de outra, estão incluídos no Apache Hadoop, Apache Spark, bases de dados NoSQL e tecnologias complementares a estas.


Uma característica importante do Apache Spark é


A

realizar processamento em lote, sendo adequado para cargas de trabalho como análises retrospectivas.


B

ser baseado no mapeamento de memória, dividindo dados em blocos e distribuindo entre os nós de um cluster.


C

utilizar in-memory cache (cache em memória) e recursos de otimização para agilizar consultas analíticas em conjuntos de dados de qualquer tamanho.


D

gerenciar e monitorar clusters de nós, otimizando o processamento por meio de paralelismo.

O modelo de programação MapReduce é essencial no ecossistema Hadoop para processamento paralelo e distribuído de grandes volumes de dados. Qual é a principal função do componente "Reduce" no modelo MapReduce?


A

Dividir os dados de entrada em partes menores que podem ser processadas em paralelo pelos mappers.


B

Processar cada parte dos dados de entrada de forma independente e gerar um conjunto intermediário de dados.


C

Agregar os resultados produzidos pelos mappers, realizando operações de síntese como somatória, contagem ou ordenação.


D

Distribuir os dados de entrada pelos diferentes nós do cluster para otimizar a eficiência do processamento.

O Apache Hadoop é um framework que permite o processamento distribuído de grandes conjuntos de dados em clusters de computadores usando simples modelos de programação. Um de seus componentes principais é o Hadoop Distributed File System (HDFS). Qual é a principal característica do HDFS que o torna particularmente adequado para o processamento de Big Data?


A

Sua capacidade de suportar bases de dados relacionais em larga escala, garantindo transações ACID para operações complexas de atualização.


B

O armazenamento de dados em blocos distribuídos por vários nós no cluster, oferecendo alta disponibilidade e tolerância a falhas.


C

A habilidade de executar operações de leitura e escrita em tempo real, facilitando o uso em aplicações de streaming de dados.


D

Seu mecanismo de indexação automática, que permite consultas extremamente rápidas semelhantes aos bancos de dados em memória.

 
 
Gerar simulado