

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
No contexto de arquiteturas modernas para o ecossistema de Big Data, a organização funcional visa gerenciar o ciclo de vida do dado sob os pilares de volume, velocidade e variedade. Considerando as camadas funcionais e os princípios de processamento distribuído, assinale a opção correta.
O processamento de dados pode ser viabilizado por modelos de computação distribuída, permitindo a execução de cargas de trabalho tanto em lotes (batch) quanto em fluxos contínuos (streaming), visando à conversão de dados brutos em informações estruturadas ou semiestruturadas para consumo posterior.
Em arquiteturas de Big Data, o paradigma predominante é o schema-on-write, que exige que todos os dados (mesmo os não estruturados) sejam validados e tipados rigidamente antes de serem persistidos no sistema de armazenamento.
A camada de consumo ou visualização é opcional, dado que a extração de valor e o suporte à decisão ocorrem de forma automática e intrínseca durante o processo de transporte de dados entre os nós do cluster.
A camada de persistência em Big Data fundamenta-se obrigatoriamente em sistemas relacionais com propriedades ACID, visando garantir a integridade referencial estrita em todas as etapas do pipeline.
A camada de ingestão limita-se à coleta de dados em repouso via processos puramente batch, sendo tecnicamente incapaz de capturar fluxos de dados contínuos originados de sensores ou logs.
Em pipelines de dados, a etapa de ingestão corresponde ao processo de eliminação permanente dos dados de origem após o carregamento no ambiente analítico.
Certo
Errado
Uma equipe de auditoria possui uma tabela de NF-e com mais de 1 bilhão de registros em um pyspark.sql.DataFrame chamado df. A auditora deseja inspecionar apenas 1.000 registros localmente em seu notebook, usando funcionalidades avançadas de pandas para buscar inconsistências. Nesse cenário, a abordagem em PySpark mais apropriada para gerar esses registros em um pandas. DataFrames, minimizando o risco de estouro de memória no ambiente local é :
pdf = df.topandas ()
pdf_sample = pdf.sample (n=1000, random state=42)
sample_df df = df.samplelFalse, 0.001, seed=42)
pdf_sample = sample_df.toPandas ()
pdf_sample = df.limit (1000) .toPandas ()
rows = df.collect ()
pdf_sample = pd.DataFrame(rows[:1000])
pdf_sample = spark.createDataFrame (df. head (10001)) .toFandas()
Uma Secretaria da Fazenda projeta um Data Lake para suportar fiscalização eletrônica, com ingestão diária de notas fiscais eletrônicas, conhecimentos eletrônicos de transporte de cargas, registros fiscais digitais entregues ao fisco, declarações do SIMPLES Nacional e recolhimentos. A equipe adota uma arquitetura em zonas (ramibronze, refined/silver, curated/gold), com processos de ELT. Para à uso por auditores fiscais e cientistas de dados, a descrição mais adequada é que a Zona raw/bronze
recebe apenas dados já deduplicados, a refined/silver armazena somente dados de terceiros; e a curated/gold contém exclusivamente dados operacionais de sistemas OLTP otimizadas para Bl e análises avançadas.
contêm apenas dados agregados históricos, a refined/silver guarda somente dados em tempo real; e a curaled/gold armazena principalmente logs de auditoria de acesso.
é usada apenas para dados não estruturados; a refined/silver apenas para dados estruturados; e a curated/gold apenas para dados semiestruturados.
é onde os auditores executam as consultas finais; a refined/silver é usada somente por times de infraestrutura, e a curated/gold funciona basicamente como área de backup de longo prazo.
armazena dados brutos conforme recebidos; a refinea/silver aplica padronização, enriquecimento e regras básicas de qualidade, a curated/gold disponibiliza modelos dimensionais ou views otimizadas para Bl e análises avançadas.
O Apache Spark é um mecanismo de análise unificado para processamento de dados em grande escala com diversas aplicações em ciência de dados, machine learning e processamento de gráficos.
Considerando essa ferramenta, julgue as afirmativas a seguir.
I. O Spark pode ser executado no Apache Hadoop, Kubernetes, por conta própria, na nuvem, em máquinas isoladas ou em clusters.
II. DataFrames, SQL e Structured Streaming são exemplos de APIs do Spark.
III. Uma diferença entre o Spark e o MapReduce é que o Spark processa e mantém os dados na memória para as etapas subsequentes, sem gravar ou ler do disco, gerando maior velocidade de processamento.
Está correto o que se afirma em
I, apenas.
II, apenas.
I e II, apenas.
II e III, apenas.
I, II e III.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
A camada de ingestão de dados é responsável por coletar e carregar dados de diversas fontes para o data lake.
Certo
Errado
Antes de processar em produção uma consulta com muitos dados que são recebidos em tempo real, um Analista de Sistemas gerou o código do Apache Spark abaixo para processar um teste de 1000 (mil) registros.
streamingDataFrame =
spark.readStream.schema(staticSchema).optio
n("maxFilesPerTrigger",
1).format("csv").option("header",
"true").load("/FileStore/tables/*.csv")
spark.conf.set("spark.sql.shuffle.partitions", "500")
retornoConsulta =
streamingDataFrame.selectExpr(--consulta--)
retornoConsulta.writeStream.format("memory").qu
eryName("tResultado").outputMode("complete
").start()
I. A função maxFilesPerTrigger especifica o número de arquivos que são lidos por vez, no formato CSV com cabeçalho e especifica a rota.
II. spark.conf.set define o tamanho de memória para um nó único.
III. O resultado da consulta pode ser acessado pelo nome da tabela “tResultado” na memória com o comando spark.sql("""SELECT * FROM tResultado""").show(5).
Estão corretas as afirmativas:
I, II e III
II e III apenas
I e III apenas
I e II apenas
No contexto de ferramentas de integração de ambientes de Big Data e Banco de Dados relacionais, associe cada descrição a seguir à respectiva ferramenta.
1. Apache Kafka.
2. Apache Sqoop.
( ) Muito usado para transferência de dados entre bancos relacionais para o ecossistema Hadoop.
( ) Suas transferências de dados são baseadas em lotes, focando em transferências programadas ou sob demanda.
( ) Muito usado para streaming de dados em tempo real.
( ) Trabalha com mensageria distribuída, baseada no conceito de tópicos, permite que produtores enviem mensagens e consumidores as processem de forma assíncrona.
A associação correta, na ordem apresentada, é
1 – 1 – 2 – 2.
2 – 1 – 1 – 2.
1 – 1 – 2 – 1.
2 – 1 – 2 – 1.
2 – 2 – 1 – 1.
A prefeitura de uma grande cidade deseja processar dados provenientes de sensores instalados no trânsito urbano, coletados em tempo real, para identificar padrões de congestionamento e propor soluções automatizadas. Nesse caso, o componente específico do Apache Spark que o torna adequado para realizar esta tarefa é o
MapReduce, que processa dados de forma distribuida, sendo ideal para o processamento em batch de grandes volumes de dados em tempo real.
framework Spark SOL, que é usado para configurar bancos de dados relacionais em tempo real, olimizando o armazenamento dos dados do trânsito.
módulo spark MLlib, que é utilizado para a coleta e processamento de dados de sensores em tempo real.
Hadoop Distributed File System (HDFS), que permite o processamento em tempo real de dados em fluxo, utilizando clusters locais para garantir baixa latência.
múdulo Spark Streaming, que permite o processamento em tempo real de dados em fluxo, utilizando micro-batches para garantir baixa latência.
Ingestão de dados é a fase do Data Lake na qual diversas fontes são coletadas, como bancos de dados transacionais, logs de servidores, entre outros tipos de dados
Certo
Errado


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Existem várias abordagens para a ingestão de dados, sendo cada uma delas adequada para determinado tipo de necessidade e de cenário.
No caso da ingestão de dados em tempo real, streaming, os dados são
coletados e processados em intervalos regulares, por exemplo, diariamente ou semanalmente.
capturados e processados continuamente à medida que são gerados.
processados em pequenos lotes, com o processamento ocorrendo em intervalos curtos, mas não instantâneos.
processados apenas após um evento específico ser acionado, como, por exemplo, uma transação em banco de dados ou um clique de usuário.
armazenados em um data lake ou data warehouse, antes de qualquer forma de processamento ou de análise.
O Elasticsearch foi criado por Shay Banon em 2010 e é mantido atualmente pela Elastic N.V., uma empresa de tecnologia conhecida por sua suíte de produtos de código aberto, incluindo o Elasticsearch, o Logstash, o Kibana e o Beats, que juntos formam o que é conhecido como a Stack ELK (ou Elastic Stack). O Elasticsearch tem como objetivo fornecer:
armazenamento de dados em formato relacional e NoSQL.
execução de consultas SQL complexas em bancos relacionais.
capacidade de indexação, busca e análise de textos completos.
integração com diversos SGBDs e bancos de dados NoSQL.
Na ingestão de dados, a arquitetura lambda utiliza o processamento em lote para fornecer visualizações das informações e utiliza a atualização em tempo real para ajudar os gestores a visualizarem dados críticos e urgentes.
Certo
Errado
A ingestão de dados consiste na coleta, importação ou transferência de dados para um sistema de armazenamento e processamento. Em geral, a ingestão de dados representa o primeiro passo em um pipeline de processamento. Os dois principais métodos de ingestão de dados são a ingestão em lote (batch) e a ingestão em tempo real (streaming).
A respeito desses métodos, avalie as afirmativas a seguir.
I. A ingestão em lotes se dá continuamente ao longo do tempo e é utilizada quando há necessidade de se processar os dados imediatamente após sua coleta.
II. A ingestão em tempo real incorpora novos dados em massa, em intervalos ou blocos periodicamente transmitidos da fonte para o dispositivo em que ocorre o processamento.
III. Em ambos os métodos, é comum que os dados sejam transformados e validados, garantindo-se assim a precisão e a consistência das informações ingeridas.
Está correto o que se afirma em
I, apenas.
II, apenas.
III, apenas.
I e II, apenas.
I, II e III.
Avalie se a ingestão de dados é um processo que consiste em:
I. Extrair dados de uma fonte e carregá-los no destino, sem qualquer transformação.
II. Extrair dados de uma fonte, transformá-los de acordo com as necessidades do sistema e carregá-los no destino.
III. Transformar dados de uma fonte de acordo com as necessidades do sistema e carregá-los no destino.
Está correto apenas o que se apresenta em
II e III.
II.
I.
I e II.
I e III.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Streaming data ingestion é uma técnica de ingestão e processamento de grandes volumes de dados ou fontes de dados de sistemas legados, em que não é possível entregar dados em fluxos; ela exige que todos os dados necessários sejam carregados em algum tipo de armazenamento, um banco de dados ou sistema de arquivos para serem processados.
Certo
Errado
O cientista de dados usa a seguinte função em Python para efetuar ingestão de dados:

O código apresentado acima executa a ingestão de dados
em lote (batch).
em streaming.
com processamento paralelo.
com processamento distribuído.
Ingestão de dados é o processo de importação e processamento de dados para uso posterior ou armazenamento em um banco de dados.
Certo
Errado
Sobre o processo de ingestão de dados, avalie se as afirmativas a seguir são verdadeiras (V) ou falsas (F).
( ) Dados não estruturados podem incluir arquivos de texto, logs e outras formas de informação não padronizada.
( ) A ingestão de dados em lote pode ser iniciada mediante agendamento ou quando os dados atingem um limite de tamanho predeterminado.
( ) Apesar de ser mais simples de implementar, a ingestão de dados incremental ou diferencial é ideal para minimizar o tráfego na rede e o uso do storage.
( ) É mais comum adicionar etapas adicionais de transformação e limpeza dos dados em dados estruturados do que em não estruturados.
As afirmativas são, respectivamente,
F – V – V – F.
V – F – F – V.
V – F – V – F.
V – V – F – F.
F – V – F – V.
O processo de ingestão de dados é normalmente dividido em três etapas principais:
1 - Extração, ou coleta, de dados das fontes disponíveis;
2 - Transformação dos dados coletados para que atendam às necessidades específicas de processamento e análise; e
3 - Carga dos dados em algum repositório de destino, como um banco de dados relacional ou um data lake.
Essas três etapas podem variar dependendo de os dados serem estruturados ou não.
Nesse contexto, verifica-se que, na etapa de
carga, os dados estruturados são sempre transferidos diretamente ao repositório de destino, sem necessidade de transformação.
carga, os dados não estruturados são sempre convertidos em formatos estruturados antes de serem armazenados.
extração, os dados estruturados são coletados exclusivamente através de APIs especializadas.
transformação, os dados estruturados podem requerer conversão para um formato não estruturado para facilitar a análise avançada.
transformação, os dados não estruturados podem necessitar de processamento de linguagem natural ou de técnicas de reconhecimento de imagens.