

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Um Auditor de Controle Externo precisa processar grandes volumes de dados de georreferenciação de obras públicas em Santa Catarina. Para otimizar o tempo, ele utiliza o paradigma MapReduce.
Na fase de MAP desse paradigma, a ação principal executada nos blocos de dados distribuídos é
consolidar todos os resultados parciais num único servidor central.
filtrar e ordenar os dados por meio de funções de agregação final.
transformar os dados de entrada em pares de chave-valor.
eliminar permanentemente os dados duplicados na base de origem.
realizar o backup dos dados em nós de redundância.
A análise de grandes volumes de dados provenientes, por exemplo, de câmeras, sensores, ocorrências, registros administrativos e redes sociais exige uma infraestrutura capaz de processar informações de forma rápida e distribuída. Nesse cenário, o MapReduce e Hadoop desempenham papel estratégico. Eles permitem que órgãos municipais transformem dados brutos em inteligência operacional, apoiando decisões em tempo real e o planejamento preventivo das ações de segurança.
Em relação à abordagem desses conceitos, assinale a opção correta.
As funções Map e Reduce são executadas sobre um fragmento de dados de entrada de forma síncrona e coordenada, respectivamente por duas fases: shuffling e indexing.
Capa Map recebe os dados no formato colunar. Cabe à função Reduce produzir um conjunto de saída da forma chave-valor, agrupando os dados relacionados em uma lista de valores.
No sistema Hadoop, o processamento é realizado com os componentes JobTracker e TaskTracker. O JobTracker entra em contato com o NameNode para obter a localização dos arquivos de entrada. Os TaskTrackers são identificados para acionarem seus mappers.
O sistema de arquivos do Hadoop HDFS implementa o modelo de processamento distribuído mestre/escravo, no qual o nó mestre (DataNode) armazena os metadados, e o conjunto de hosts colaboradores, chamados NameNodes, administra os dados que chegam.
O sistema HDFS adota uma abordagem baseada em conteúdo para nomear e estruturar arquivos em uma sequência blocos de tamanho variável armazenados nos DataNodes, com alocação dinâmica.
A tecnologia para análise de Big Data e processamento de dados conhecida como Hadoop é uma implementação em código aberto do modelo de programação:
HDFS.
MapReduce.
YARN.
TaskMap.
JobReduce.
MapReduce é uma técnica de processamento de dados massivos que divide as operações em duas fases, map e reduce, e utiliza o processamento paralelo para executar cada fase de forma independente em diferentes nós de um cluster.
Certo
Errado
O Processamento MapReduce é o paradigma fundamental para o processamento distribuído de Big Data em clusters.
Um cientista de dados usou essa técnica para processar milhões de logs de auditoria, em que a fase Map já emitiu pares chavevalor intermediários (ex: (UsuárioID, 1)).
De acordo com modelo MapReduce, assinale a opção que apresenta a função exata e sequencial da fase Shuffle & Sort que é crítica para preparar os dados para a posterior agregação na fase Reduce.
Coletar a saída intermediária dos Mappers, transportar, particionar e ordenar esses pares chave-valor, garantindo que todas as ocorrências de uma mesma chave sejam agrupadas e enviadas ao mesmo Reducer.
Coletar os dados brutos da fonte de dados distribuída e aplicar a função de filtragem inicial (Map) em cada nó de processamento.
Aplicar a função de agregação de redução (Reduce) nas chaves recebidas, calculando a soma final em uma única operação.
Persistir a saída final no HDFS e coordenar a distribuição de blocos entre os DataNodes do cluster
Realizar o split lógico dos arquivos de entrada em blocos menores e garantir a tolerância a falhas através da replicação automática.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Acerca da arquitetura de sistemas analíticos e do ecossistema Apache Hadoop, julgue os próximos itens.
O MapReduce, um dos componentes principais do Hadoop, foi projetado para atender a demandas analíticas de alta frequência e baixa latência.
Certo
Errado
Mapas de contorno são utilizados para representar a distribuição de dados contínuos, como a variação da produtividade agrícola, conectando pontos de mesmo valor por meio de linhas que delimitam regiões de igual intensidade.
Certo
Errado
MapReduce é particularmente eficiente para tarefas de baixa latência e processamento em tempo real, sendo amplamente utilizado para atender a essas necessidades.
Certo
Errado
O processamento MapReduce consiste na aplicação de um algoritmo de computação distribuída para processar grandes conjuntos de dados em um cluster de computadores, dividindo cálculos complexos em tarefas menores e que podem ser executadas em paralelo. O MapReduce é implementado em etapas. Em uma dessas etapas, os dados de entrada divididos em partes são transformados em conjuntos de pares chave-valor (i.e., key-value pairs) adequados para o processamento paralelo e distribuído.
A essa etapa do MapReduce dá-se o nome de
divisão de entrada (input splitting).
mapeamento (mapping).
embaralhamento (shuffling).
classificação (sorting).
redução (reducing).
Um exemplo da aplicação do MapReduce bem conhecido é a contagem de palavras num arquivo de texto. A partir de um arquivo com linhas de texto, a tarefa é produzir a lista de palavras acompanhadas com a frequência que aparecem no texto.
A sequência mais adequada de aplicação das fases para essa tarefa, além das fases de entrada e saída, é:
Mapping – Reducing – Shuffling – Splitting.
Splitting – Counting – Mapping – Reducing.
Splitting – Mapping – Counting – Reducing.
Splitting – Mapping – Shuffling – Counting;
Splitting – Mapping – Shuffling – Reducing;


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Analise o trecho a seguir:
É um padrão de transformação de dados em lote que foi introduzido como uma alternativa para lidar com grandes volumes de dados. Consiste em tarefas de mapa que leem blocos de dados individuais espalhados pelos nós, seguidas por uma etapa de shuffle que redistribui os dados de resultado e uma etapa de redução que agrega os dados em cada nó. Seu paradigma foi construído em torno da ideia de que a capacidade e largura de banda do disco magnético eram tão baratas que fazia sentido simplesmente usar uma enorme quantidade de disco para realizar consultas ultrarrápidas.
A tecnologia em questão é:
Apache Spark.
Hadoop MapReduce.
Business Warehouse.
ETL (Extract, Transform, Load).
GIS (Geographic Information System).
Nas últimas décadas, a automatização e a inserção de máquinas agrícolas transformaram profundamente o panorama do trabalho nas áreas rurais [...] e, em menos de 50 anos, a produtividade do agronegócio brasileiro aumentou 400%. [...]
Esses resultados vieram com a adoção da tecnologia nos processos cotidianos, e também com o investimento em pesquisas [...]. Agora, o agronegócio pode estar diante de um novo salto de produtividade; big data e machine learning são ferramentas que estão ganhando espaço e que podem, novamente, transformar o cenário do campo.
Disponível em: https://summitagro.estadao.com.br/tendencias-e-tecnologia/como-big-data-e-machine-learning-sao-aplicados-no-agronegocio/. Acesso em: 5 jan. 2024. Adaptado.
A utilização da plataforma paralela de processamento MapReduce aplica-se adequadamente como um framework de processamento de Big Data, visando à escalabilidade para as aplicações.
Nesse contexto, uma característica inerente à MapReduce é a
sua abordagem, que reflete uma solução simplificada de processamento de dados paralelos em um cluster.
sua função map(), que gera, para cada registro de entrada, um ou mais pares (chave,valor).
sua função reduce(), que gera um resultado combinado em valores que compartilham chaves distintas.
sua demanda pela existência de um esquema de dados.
natureza estática de suas funções, que devem respeitar a especificação original, caracterizando uma restrição inerente a essa abordagem.
No Hive do Apache Hadoop, as consultas são escritas em SQL; para tal, é necessário o conhecimento do MapReduce.
Certo
Errado
Dados são importantes elementos de apoio à tomada de decisão, sendo que algumas aplicações geram quantidade massiva e heterogênea de dados, com alta velocidade.
Para lidar com esse cenário, foi desenvolvido o seguinte modelo de programação que consiste em dividir, processar e combinar os dados em paralelo, de forma a acelerar o processamento e garantir a confiabilidade dos resultados:
Data Warehousing.
Elastic Search.
Hadoop.
MapReduce.
NoSQL.
MapReduce é um framework de processamento paralelo para clusters inspirado em programação funcional, que teve seu artigo seminal publicado em 2004 no artigo : “MapReduce: Simplified Data Processing on Large Clusters”.
Com relação à tecnologia MapReduce, assinale V para a afirmativa verdadeira e F para a falsa.
( ) A ideia principal do MapReduce é dividir e processar tarefas e depois juntar as informações, o que permite dividir um grande problema em vários pedaços e distribuí-los em diversos computadores.
( ) Os principais passos correspondem a: (i) Input split, onde a entrada é dividida em várias partes, onde cada parte será consumida por um Map; (ii) Map, onde é criada uma lista de pares chave-valor; (iii) Shuffling , onde se classifica e agrupa a saída da etapa anterior para servir de entrada para a seguinte; (iv) Reduce, onde se processa a saída da etapa anterior e se agregam as informações; (v) Output, quando as informações são retornadas.
( ) As principais características do MapReduce se referem a esconder os detalhes do processamento em série, tolerância a falhas, otimização de localidade e balanceamento de memória, que resultam em modelo fácil de usar, mesmo para programadores sem experiência com sistemas paralelos e distribuídos.
As afirmativas são, respectivamente,
F – V – F.
V – V – V.
V – F – V.
V – V – F.
F – F – V.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
As regiões são a unidade básica de trabalho no HBase, que é usada como divisão pela estrutura de redução do mapa; a região contém objetos de armazenamento que correspondem a famílias de colunas.
Certo
Errado
Mediante a quantidade de dados gerados pela Defensoria Pública do Estado de Mato Grosso do Sul, o engenheiro da computação optou por utilizar uma técnica para distribuir o processamento de vastíssimos arquivos de dados multiestruturados ao longo de grandes clusters de máquinas. Essa técnica é denominada
IHC.
Esferilização.
Nanotecnologia.
SATA.
MapReduce.
Apache Hadoop é o principal framework utilizado no processamento e armazenamento de grandes conjuntos de dados (Big Data). No ecossistema Apache Hadoop, além dos componentes básicos, diversas ferramentas e serviços suprem necessidades de negócios, aplicações e arquitetura de dados. O sistema de agendamento de WorkFlow para gerenciar os jobs de computação distribuída do MapReduce é o:
Spark.
Oozie.
Flume.
Mahout.
MapReduce é uma ferramenta de uso restrito a frameworks de Big Data, como o Hadoop, e deve ser aplicado exclusivamente no tratamento de dados estruturados, sendo ineficiente para processar dados não estruturados.
Certo
Errado
A consultora Fernanda encontrou o método Java a seguir em um código de terceiros.

Como Fernanda conhece muito bem as operações de map e reduce do Java, ela logo descobriu que w representa:
o desvio padrão do conjunto de valores do HashMap;
a média ponderada dos valores do HashMap, considerando as chaves como peso;
o produtório do conjunto de valores do HashMap;
a obtenção da chave relacionada à lista de maior valor médio;
o somatório dos produtos entre as chaves do HashMap e as listas de valores relacionadas.