

Seu próximo nível começa aqui
Com a Assinatura Ilimitada, você tem tudo que precisa para sua aprovação.
Com a Assinatura Ilimitada, você combina prática, teoria e método em uma única assinatura com tudo que você precisa para sua aprovação.
Assinale a alternativa que descreve o conceito de transformação de dados em um processo de ETL (Extract, Transform, Load).
Extração de dados brutos.
Conversão e padronização de dados.
Armazenamento dos dados em destino.
Monitoramento de processos.
Geração de relatórios.
Uma SEFAZ carrega dados fiscais brutos em um data lake para retenção e só realiza transformações sob demanda no ambiente analítico. Nesse caso, o padrão de engenharia de dados adequado é
ELT, pois a carga ocorre primeiro e a transformação é posterior conforme necessidade.
ETL, pois o data lake é necessariamente um destino final e não permite transformação posterior.
ETL, pois a transformação precisa ocorrar antes de qualquer persistência.
Streaming ETL, pois retenção histórica implica processamento em tempo real.
ETL paralelo, pois o data lake substitui a etapa de transformação por particionamento.
Diversos dashboards disponíveis no TJRJ exibem informações oriundas de vários sistemas de informação, tanto internos quanto externos. Com isso, é necessário realizar o tratamento dos dados que serão visualizados nos dashboards.
No Power BI, para implementar rotinas de ETL (Extração, Transformação e Carga), permitindo importar dados de diversas fontes e tratá-los antes de serem usados para visualização, deve-se utilizar:
Script R;
Gateway;
Power Pivot;
Power Query;
Segmentações.
Com relação aos conceitos e tipos ELT e ETL de pipeline de dados, analise as afirmativas a seguir.
I. A abordagem ELT é recomendada para tarefas relacionadas a LGPD porque realiza a limpeza de dados sensíveis antes que eles atinjam o sistema de destino, reduzindo riscos de segurança e economizando espaço de armazenamento.
II. No processo ETL, o conjunto de dados completo e sem tratamento é carregado diretamente no sistema de destino. Como há apenas uma etapa, e ela ocorre apenas uma vez, o carregamento no processo ETL é mais rápido do que no ELT.
III. Na abordagem ELT, é possível aproveitar o poder de processamento distribuído e a escalabilidade elástica do data warehouse de destino para realizar transformações via SQL, eliminando a necessidade de um servidor de processamento intermediário.
É verdadeiro o que é afirmado em
I e II, apenas.
I e III, apenas.
II, apenas.
III, apenas.
I, II e III.
Em um pipeline de dados, o modelo ETL (Extract, Transform, Load) caracteriza-se pela realização das transformações antes da carga dos dados no sistema de destino, enquanto o modelo ELT (Extract, Load, Transform) adia as transformações para depois da ingestão dos dados em um ambiente analítico. Nesse contexto, a alternativa mais coerente com os impactos em escalabilidade, custo computacional e planejamento em cenários de big data é:
Em pipelines baseados em ETL, as transformações realizadas antes da carga exigem maior planejamento das regras de negócio, dos recursos computacionais intermediários e dos custos de processamento, especialmente quando o volume de dados é elevado.
O modelo ELT pressupõe que todas as transformações sejam simples e de baixo custo, pois a escalabilidade do ambiente analítico dispensa preocupações com uso de recursos computacionais.
Em ambientes de big data, o uso de ETL elimina a necessidade de planejamento prévio da infraestrutura, uma vez que as transformações são realizadas fora do sistema de destino, reduzindo custos operacionais.
A adoção de ELT inviabiliza práticas de governança e controle de qualidade, uma vez que dados brutos são carregados sem transformação prévia.
ETL e ELT apresentam impactos equivalentes em termos de custo e desempenho, sendo a escolha entre eles determinada pela ferramenta de orquestração adotada.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
O processo de ETL, em soluções de BI, tem como objetivo principal garantir a integridade, a padronização e a qualidade dos dados antes da disponibilização destes em um data warehouse.
Certo
Errado
A Secretaria de Saúde de um município está implementando um sistema de análise de dados para monitorar atendimentos em unidades de saúde. O cientista de dados apresentou duas abordagens para integrar dados de diferentes postos de saúde.
• Abordagem 1
− Extrair dados dos sistemas de cada posto (CSV, Excel, bancos locais)
− Transformar os dados em um servidor intermediário: padronizar formatos de data, validar CPF, limpar dados inconsistentes, calcular métricas agregadas
− Carregar apenas os dados já processados e limpos no Data Warehouse
• Abordagem 2
− Extrair dados dos sistemas de cada posto
− Carregar os dados brutos diretamente no Data Lake (Amazon S3)
− Transformar os dados, quando necessário, usando ferramentas de análise (SQL, Python, Spark)
Sobre essas abordagens, é correto afirmar que:
ambas as abordagens são exemplos de ETL, diferindo apenas no local onde as transformações são executadas, sendo a primeira em servidor dedicado e a segunda no próprio Data Warehouse;
a abordagem 1 é mais moderna e escalável que a abordagem 2, pois permite que todas as transformações sejam feitas em um único servidor centralizado, eliminando a necessidade de capacidade computacional no destino;
a principal vantagem da abordagem 1 é que ela preserva os dados originais completos, permitindo aplicar novas regras de transformação no futuro sem precisar reextrair das fontes, enquanto a abordagem 2 descarta os dados brutos após a transformação;
a abordagem 1 representa um processo ELT (Extract-Load-Transform), onde as transformações ocorrem após o carregamento no destino, enquanto a abordagem 2 representa ETL (Extract-Transform-Load), onde transformações ocorrem antes do carregamento;
a abordagem 1 representa um processo ETL (Extract-Transform-Load), adequado quando se deseja carregar apenas dados validados no warehouse, enquanto a abordagem 2 representa ELT (Extract-Load-Transform), adequado quando se deseja preservar dados brutos para análises exploratórias futuras.
No processo de ETL, a fase de Transformação é a mais crítica para garantir a qualidade e a consistência dos dados que serão carregados no Data Warehouse.
Assinale a opção que descreve uma operação tipicamente executada na fase de Transformação.
Utilizar um Log Miner para capturar dados alterados diretamente do log de transações do banco de dados de origem (OLTP).
Aplicar a desnormalização do esquema, realizar a limpeza de dados e calcular novas métricas antes do carregamento.
Criar a conexão de rede e estabelecer o protocolo de transferência de dados entre a fonte e o destino.
Forçar o uso de índices de bitmap e full-text na Tabela Fato para otimizar o tempo de busca durante as consultas OLAP.
Executar o comando TRUNCATE TABLE no Data Warehouse para remover todos os dados existentes antes de carregar o novo lote.
Uma Secretaria da Fazenda Estadual recebeu uma base de dados contendo 2,3 milhões de registros de declarações fiscais para análise de conformidade tributária. Durante a fase de exploração inicial, a equipe técnica identificou diversos problemas: campos de CNPJ com formatações inconsistentes (alguns com pontuação, outros sem), valores monetários registrados com separadores decimais divergentes (vírgula e ponto), datas em formatos distintos (DD/MM/AAMA, AMAA-MM-DD), campos obrigatórios vazios em aproximadamente 12% dos registros, e a presença de valores extremos de receita bruta (outliers) que distorciam as análises estatísticas. Além disso, a variável "regime tributário" apresentava categorias redundantes devido a erros de digitação (ex “Simples Nacional”, “SIMPLES NACIONAL”, “Simples nacional). Para viabilizar a análise de risco fiscal e a construção de modelos preditivos, tomou-se necessário aplicar técnicas sistemáticas de preparação dos dados antes do processamento analítico. Considerando as melhores práticas de pré-processamento de dados, o tratamento correto e adequado para essa situação é
aplicar tokenização em campos textuais para fragmentar as informações em unidades menores, utilização de técnicas de stemming e lemmatização para uniformizar as categorias de regime tributário, implementação de métodos de detecção de anomalias baseados em Isolation Forest para identificar registros fiscais suspeitos e preenchimento de valores ausentes mediante algoritmos de interpolação linear ou polinomial, assegurando a completude da base de dados para processamento posterior.
iniciar com a aplicação de técnicas de feature scaling através de padronização z-score em todas as variáveis numéricas para centralizá-las em média zero e desvio padrão unitário, seguida de codificação ordinal para variáveis categóricas respeitando hierarquias naturais, detecção de outliers multivariados mediante distância de Mahalanobis e imputação de dados faltantes exclusivamente por valores constantes predefinidos conforme regras de negócio tributário, evitando métodos estatísticos que alterem distribuições originais.
priorizar, inicialmente, a exclusão automática de todos os registros que apresentem campos obrigatórios vazios, seguida da aplicação de técnicas de winsorização para substituir valores extremos pelos percentis 5 e 95, padronização das strings mediante conversão para maiúsculas e remoção de acentuação, garantindo assim a integridade da base sem necessidade de imputação de dados faltantes que poderia introduzir viés nas análises tributárias.
aplicar técnicas de normalização min-max em todas as variáveis numéricas para escaloná-las entre 0 e 1, realizar a codificação one-hot encoding nas variáveis categóricas, incluindo a variável regime tributário, implementar detecção de outliers através do método de Tukey (I0R) com remoção automática dos valores identificados e utilizar forward fill para preencher dados faltantes sequencialmente, preservando a ordenação temporal dos registros fiscais.
padronizar formatos mediante expressões regulares para unificar CNPJ, valores monetários e datas em padrões consistentes, tratamento de dados faltantes atraves de análise contextual para decidir entre imputação (por média, mediana ou algoritmos como KNN) ou exclusão baseada em criticidade; normalização de texto com conversão para caixa baixa, remoção de espaços extras para eliminar duplicatas categóricas; e análise criteriosa de outliers distinguindo valores legítimos de erros de registro antes de qualquer ação corretiva.
Uma das técnicas utilizadas na etapa de transformação do processo de ETL é a derivação, em que são vinculados dados semelhantes oriundos de diferentes fontes de dados.
Certo
Errado


Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
A etapa de transformação em um processo de ETL tem como um de seus pilares o perfilamento, cujo objetivo é a identificação de quais dados estão armazenados em formato diferente do padrão esperado.
Certo
Errado
Em ETL, a transformação de uma linha que contém colunas com múltiplas ocorrências em uma linha para cada instância dos dados com múltiplas ocorrências é um exemplo de normalização de dados da etapa transform.
Certo
Errado
Nos processos de integração de dados, o ETL (Extract, Transform, Load) é amplamente utilizado para consolidar informações provenientes de diferentes fontes em repositórios analíticos, como Data Warehouses ou Data Marts. A etapa de Load (Carga) corresponde à inserção dos dados no sistema de destino após o processo de extração e transformação. Nesse contexto, existem diferentes estratégias de carga de dados. Uma delas é caracterizada por carregar apenas registros novos ou que foram alterados desde a última execução do processo, otimizando o desempenho e reduzindo o volume de processamento. Considerando isso, assinale a alternativa que corresponde CORRETAMENTE a esse tipo de carga.
Carga incremental.
Carga completa.
Carga histórica.
Carga estática.
O processo de ETL (Extract, Transform, Load) é fundamental para a construção de Data Warehouses.
Qual etapa do processo de ETL é responsável por converter os dados extraídos para um formato consistente e adequado para análise?
Carga (Load).
Extração (Extract).
Validação (Validation).
Transformação (Transform).
Orquestração (Orchestration).
Um analista de dados de uma agência reguladora está desenvolvendo um painel para monitorar indicadores de desempenho do setor. Ele está utilizando uma ferramenta de BI que envolve um processo de ETL (Extração, Transformação e Carga) para preparar os dados.
Analise as seguintes proposições sobre as etapas do processo de BI:
I. Extração (Extract): É a fase de coleta de dados de diversas fontes, que podem ser bancos de dados relacionais (SQL Server, Oracle), planilhas (Excel), arquivos de texto (CSV), serviços web (APIs), entre outros.
II. Transformação (Transform): Nesta fase, os dados extraídos são limpos, padronizados, combinados e modelados. Podem ser realizadas operações como remoção de duplicatas, cálculo de novas colunas e criação de hierarquias para preparar os dados para a análise.
III. Carga (Load): Após a transformação, os dados são carregados no modelo de dados da ferramenta de BI (como o Power BI ou Qlik Sense), onde ficarão disponíveis para a criação de relatórios e dashboards interativos.
Está correto o que se afirma em:
II e III, apenas.
III, apenas.
I, apenas.
I e II, apenas.
I, II e III.


Seu próximo nível começa aqui

Seu próximo nível começa aqui
Destrave a preparação completa para sua aprovação. Com a Assinatura Ilimitada, você estuda com os melhores professores do Brasil e todos os recursos Gran.
Na consolidação de bases ambientais heterogêneas que envolvam dados geoespaciais, séries temporais, sensores remotos e registros administrativos, as arquiteturas ETL e ELT são empregadas de forma estratégica, conforme requisitos de qualidade, escalabilidade e governança. Assinale a opção que apresenta uma vantagem conceitual do ELT em ambientes analíticos ambientais modernos.
padronização rígida exigida na origem dos dados ambientais
redução do volume de dados brutos carregados
transformações obrigatoriamente executadas antes do armazenamento dos dados
ocorrência de transformações após carregamento no repositório analítico
eliminação da necessidade de governança e controle de qualidade
Como data warehouse é não volátil, a etapa intermediária do ETL deve efetuar todos os tratamentos necessários nos dados para melhorar a sua qualidade.
Certo
Errado
Na etapa de transformação dos dados no processo de descoberta de informação, a técnica que mapeia dados de alta cardinalidade em um espaço de dimensão inferior, de tal forma que a informação relevante para o problema de aprendizado seja preservada, é chamada de
Embedding.
Hashed Feature.
Feature Cross.
Reframing.
Ensembles.
Considerando um processo de extração e carga executado uma vez ao dia, latência é o tempo decorrido entre a leitura do dado na base de origem e a gravação no data warehouse.
Certo
Errado
Com relação a processos de banco de dados ETL (extração, transformação e carga), julgue os itens subsequentes.
Na extração incremental, apenas os dados alterados desde a última carga são extraídos, tornando o processo mais eficiente que a extração full, que recupera todos os dados da fonte.
Certo
Errado