

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Um time está implementando uma arquitetura Data Lakehouse para suportar as atividades de Business Intelligence (Bl) e Machine Learning. Considerando a necessidade de garantir qualidade nos dados para relatórios analíticos, a ação fundamental para assegurar a consistência das informações durante processos de ETL/ELT com atualizações concorrentes é
utilizar ferramentas de visualização de dados com capacidade de processamento in-memory para agilizar a geração de dashboaras.
implementar uma camada de metadados com suporte a transações ACID sobre o armazenamento cloud, usando formatos como Delta Lake, Iceberg ou Hudi.
configurar pipelines de dados em fluxo continuo (streaming) para ingestão imediata dos dados nas camadas de apresentação.
aplicar técnicas de modelagem dimensional, como esquemas estrela e floco de neve, na camada de armazenamento do Data Lake.
utilizar ferramentas de Data Catalog para documentar metadados business e técnicos dos conjuntos de dados.
No ciclo de vida CRISP-DM (Cross-Industry Standard Process for Data Mining), usado em Ciência de Dados, qual etapa trata da limpeza, tratamento e formatação dos dados:
Coleta de Dados.
Visualização dos Dados.
Preparação dos Dados.
Entendimento dos Dados.
Avaliação.
A analista Katy está preparando um conjunto de dados para ser utilizado no treinamento de um modelo de inteligência artificial. A fonte dos dados possui informações pessoais.
Para estar em conformidade com a LGPD, Katy deve remover informações pessoais identificáveis antes do uso em treinamentos de modelos por meio de:
anonimização;
transparência;
explicabilidade;
consentimento;
vieses algorítmicos.
No processo de descoberta de conhecimento em bases de dados, a qualidade dos resultados obtidos pelos algoritmos de aprendizado de máquina está diretamente vinculada à qualidade dos dados de entrada. Dados provenientes de fontes heterogêneas, frequentemente, apresentam ruídos, redundâncias e lacunas que podem enviesar as análises estatísticas.
Dentro do fluxo de trabalho de Ciência de Dados, o conjunto de operações que envolve o tratamento de dados faltantes (null/missing values), a normalização de formatos, a remoção de registros redundantes e a correção de erros de digitação ou inconsistências lógicas é tecnicamente denominado
limpeza de dados (Data Cleaning).
mineração de dados (Data Mining).
análise exploratória de dados (EDA).
integração de dados (Data Integration).
engenharia de atributos (Feature Engineering).
Em uma iniciativa de Business Intelligence, uma instituição consolidou dados provenientes de sistemas transacionais distintos para alimentar painéis gerenciais, análises OLAP e modelos exploratórios de descoberta de padrões. Durante a revisão da arquitetura, foram avaliados processos de ETL, regras de qualidade de dados, granularidade das cargas, tratamento de dimensões lentamente mutáveis e uso de técnicas de Data Mining. Com base no tema, analise as sentenças a seguir:
I- Em processos de ETL, a etapa de transformação pode envolver padronização de formatos, tratamento de valores ausentes, remoção de duplicações, conversão de tipos, aplicação de regras de negócio e conformidade entre dimensões oriundas de fontes distintas.
II- A qualidade dos dados em ambientes analíticos depende exclusivamente da ferramenta de visualização utilizada, pois inconsistências de origem, duplicidades, ausência de chaves de integração e divergências semânticas são corrigidas automaticamente durante a renderização dos dashboards.
III- Técnicas de Data Mining podem ser utilizadas para identificar padrões, associações, agrupamentos, classificações ou tendências em grandes conjuntos de dados, mas seus resultados exigem interpretação crítica, validação e atenção a vieses, qualidade da amostra e pertinência do modelo.
IV- A carga incremental em um Data Warehouse elimina a necessidade de controle temporal dos dados, pois qualquer alteração em sistemas de origem deve sobrescrever integralmente os registros históricos para preservar apenas o estado atual das informações.
Analisadas as sentenças, estão CORRETAS apenas:
I e II.
I e III.
I e IV.
II e III.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Em um data lake, os dados brutos podem ser carregados sem que seja necessário um pré-processamento, como o ETL, para a padronização das informações.
Certo
Errado
Um Analista de um Tribunal Regional do Trabalho está configurando o Elastic Stack (Elasticsearch, Logstash e Kibana) integrado ao AWS para coletar, indexar e analisar logs de serviços da AWS, como CloudTrail e CloudWatch. À sequência de ações que ele deve utilizar para configurar o pipeline de dados e realizar a análise dos logs é
utilizar o Kibana para coletar logs diretamente do AWS CloudTrail, o Logstash para visualizar os logs e o Elasticsearch para criar dashboards.
configurar o Elasticsearch para coletar os logs diretamente do AWS CloudWatch, usar o Kibana para transformar os dados em pipelines e o Logstash para criar relatórios.
usar o Kibana para indexar os logs do AWS CloudTrail, enviar os dados para o Logstash e armazená-los no Elasticsearch.
configurar o Logstash para ingerir logs do AWS CloudTrail e CloudWatch, enviar os dados para o Elasticsearch para armazenamento e realizar a análise visual dos logs com Kibana.
configurar o Elasticsearch para ingerir dados de logs e usar o Logstash para criar dashboards customizados.
O pré-processamento de dados é uma tarefa necessária para a mineração de dados. Alguns problemas como integração de esquema, tratamento de dados redundantes, detecção e resolução de conflitos de valores são tratados em qual das etapas de pré-processamento de dados?
Redução de dados.
Limpeza de dados.
Integração de dados.
Transformação de dados.
No contexto de auditoria e compliance, a pilha ELK Stack (Elasticsearch, Logstash e Kibana) é amplamente usada para analisar e monitorar atividades nos sistemas, especialmente no que se refere à integridade e à segurança de dados.
Sobre as funcionalidades dessa pilha, assinale a afirmativa correta.
O Elasticsearch é o componente responsável pela coleta de logs em tempo real, permitindo que os dados sejam enviados diretamente para o Kibana para análise visual.
O Logstash é responsável por realizar a visualização de dados e criação de dashboards interativos a partir dos logs coletados.
A pilha ELK Stack é limitada à análise de logs de bancos de dados e não é adequada para sistemas de monitoramento de redes ou aplicativos.
O Logstash coleta, processa e armazena dados, mas não permite que transformações sejam aplicadas aos logs antes de serem enviados para o Elasticsearch.
O Kibana oferece uma interface gráfica para análise e visualização dos dados processados pelo Logstash e armazenados no Elasticsearch.
Uma Secretaria da Fazenda está implementando um Data Warehouse para aprimorar a análise histórica de dados fiscais e otimizar a tomada de decisões estratégicas. A melhor prática para garantir a qualidade dos dados e a eficiência das consultas é
implementar um pipeline de ETL estruturado, aplicando técnicas de limpeza, agregação e conformidade dos dados antes do carregamento no Data Warehouse, para assegurar a integridade referencial, a consistência semântica e a performance das consultas analíticas.
priorizar um modelo ELT (Extract, Load, Transform) em vez de ETL, pois carregar os dados diretamente no Data Warehouse antes da transformação proporciona maior flexibilidade para ajustes futuros e evita a perda de informações relevantes.
modelara estrutura do Data Warehouse exclusivamente com tabelas de fato, pois elas armazenam os eventos principais e eliminama necessidade de tabelas dimensionais, otimizando o armazenamento eaposterior análise.
projetar a modelagem dimensional garantindo que a funcionalidade de drill up permita explorar os dados em níveis de detalhamento cada vez mais específicos e que a funcionalidade de drill down agregue informações para gerar análises mais resumidas e sintéticas.
evitar processos de carga periódica no Data Warehouse e utilizar prioritariamente ETL em tempo real, garantindo que todas as análises sejam feitas com base em snapshots de dados mais recentes e relevantes.


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Em um projeto de BI (Business Intelligence), dados de vendas são coletados de várias filiais que usam sistemas diferentes. Os dados de “Unidade Federativa” chegaram em formatos inconsistentes (ex: “SP”, “São Paulo”, “S. Paulo”, “sp”). Para que os relatórios sejam precisos, esses valores precisam ser padronizados para um único formato (ex: “SP”).
Com base nessa situação hipotética e no contexto de um pipeline de ETL, assinale a opção que apresenta a fase em que essa operação de limpeza e padronização de dados deve ocorrer.
extração
transformação
carga
data source
data mart
No ETL, a qualificação de dados engloba o processo de conformidade, no qual são identificados registros repetidos.
Certo
Errado
Durante a preparação de um conjunto de dados para análise preditiva de inadimplência, um cientista de dados identificou diversos problemas de qualidade nos dados, incluindo:
• campos numéricos com valores negativos que não fazem sentido (como "idade" ou "renda");
• colunas categóricas com múltiplas grafias para a mesma categoria (ex: "PE", "pe", "Pernambuco");
• presença de valores nulos em campos-chave como “renda” e “número de dependentes”;
• valores repetidos na chave primária “ID cliente”.
Com base nas dimensões de qualidade de dados e nas boas práticas de tratamento com Python - especialmente usando Pandas -, é correto afirmar que a:
validação para garantir que a idade não seja negativa é uma verificação de conformidade e pode ser realizada no Pandas, utilizando filtros booleanos.
detecção e remoção de duplicatas de chave primária atende à dimensão de completude, e deve ser feita usando dropna.
padronização de grafias em colunas categóricas está relacionada à dimensão de integridade, enquanto o tratamento de nulos se refere à unicidade.
substituição de valores nulos por zero é recomendada em todos os casos, pois preserva a precisão dos dados para modelagem.
coluna com grafias variadas não compromete a análise, desde que os dados estejam completos, pois está dentro da acurácia esperada.
Durante a implementação de um novo sistema de BI, a Hemobrás identificou que sua base de dados transacional possui diversas inconsistências, incluindo valores nulos para a quantidade de medicamentos distribuídos e registros duplicados de hospitais. Para garantir a qualidade dos dados antes de carregá-los em um data warehouse, a equipe de TI deve aplicar corretamente o processo de ETL. Qual das opções a seguir melhor descreve as etapas de extração, transformação e carga (ETL) necessárias para corrigir essas inconsistências antes da análise?
Correção manual dos registros inconsistentes, garantindo que a equipe de TI revise todos os valores antes da extração para evitar que dados imprecisos sejam carregados.
Armazenamento dos dados transacionais no data warehouse sem alterações, permitindo que a limpeza seja feita posteriormente pelos analistas de BI ao gerar os relatórios.
Remoção de registros duplicados e tratamento de valores nulos na etapa de transformação, antes do carregamento no data warehouse, para assegurar a qualidade dos dados.
Extração dos dados brutos da base transacional, seguida de um processo de carga direta no data warehouse para garantir que todas as informações originais sejam preservadas.
Ao lidar com valores faltantes em um conjunto de dados, é essencial aplicar técnicas adequadas para garantir a integridade e a qualidade das análises subsequentes. A presença de dados ausentes pode distorcer resultados, introduzir vieses e comprometer a eficácia de modelos preditivos. Portanto, a escolha da abordagem correta para tratar esses valores é fundamental. Observe as afirmativas a seguir, em relação às técnicas é utilizada para lidar com valores faltantes em um conjunto de dados:
I.Remover todas as linhas com valores faltantes.
II.Substituir valores faltantes pela média ou mediana.
III.Utilizar algoritmos que suportam valores faltantes.
Assinale a alternativa correta:
Todas as afirmativas estão corretas.
Apenas as afirmativa II e III estão corretas.
Apenas a afirmativa II está correta.
Apenas as afirmativas I e III estão corretas.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Business Intelligence (BI) é um conjunto de processos, metodologias, tecnologias e ferramentas utilizadas para coletar, integrar, analisar e apresentar informações relevantes sobre uma organização ou negócio. O objetivo principal do BI é ajudar as empresas a tomar decisões mais informadas e estratégicas, fornecendo insights baseados em dados precisos e oportunos.
Processos conhecidos como ETL são comumente utilizados no contexto de arquiteturas de soluções de BI. A etapa do ETL onde ocorre remoção de dados duplicados, correção de erros, conversão de formatos de dados, agregação de dados e enriquecimento de dados com informações adicionais é:
a extração.
a transformação.
o processamento.
a carga.
A analista Elizabeth está trabalhando no levantamento das bases de dados do TJMS para conhecer a estrutura e o conteúdo dessas bases. Elizabeth precisa levantar informações como: quantidade de tabelas, quantidade de registros, valores válidos, formatos dos dados, restrições de integridade, entre outros.
Para isso, Elizabeth deve utilizar uma ferramenta de:
ETL;
lineage;
profiling;
modelagem;
indexação.
Uma das técnicas utilizadas em ETL é a separação, conforme a qual um dado do tipo texto pode ser dividido em textos menores.
Certo
Errado
Processamento de dados é uma operação crítica em diversas áreas da tecnologia e gestão da informação, englobando uma série de atividades voltadas para a transformação de dados brutos em informações úteis e compreensíveis. O processo de remover ou corrigir dados errôneos, preencher lacunas e formatar os dados numa estrutura consistente, é denominado:
Coleta de Dados.
Relatório e Visualização.
Processamento e Análise de Dados.
Preparação e Limpeza de Dados.
Armazenamento de Dados.
Sistemas de apoio à decisão coletam dados de diversas fontes e precisam realizar diversas operações de limpeza, transformação e integração para carregá-los em um banco de dados analítico pronto para consultas.
Para realizar as transformações necessárias nos dados oriundos de diversas fontes, os dados devem ser armazenados temporariamente em um(a):
dashboard;
cubo de dados;
staging area;
barramento;
repositório de metadados.