

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Uma Secretaria da Fazenda quer unificar, em nuvem, dados de NF-e, escriturações fiscais digitais, transações de cartão de crédito e cruzamentos de malha fiscal em um único ambiente. Esse ambiente deve sustentar relatórios de arrecadação (Bl) e, também, experimentos de ciência de dados e modelos de machine learning para detectar empresas “laranja”. Já existem um Data Lake em Parquet e um Data Warehouse legado em banco relacional. Considerando governança, desempenho para Bl e flexibilidade analítica, a decisão arquitetural mais adequada a esse cenário é
centralizar tudo no Data Warehouse relacional, incluindo XML de NF-e, logs e dados semiestruturados convertidos para tabelas normalizadas, garantindo um repositório único e estável para Bl e analytics, ainda que exija expansão significativa de armazenamento e processamento.
desativar o Data Warehouse e operar sobre o Data Lake, adotando apenas schema-on-read para maximizar flexibilidade e reduzir custos, permilindo que equipes de Bl e ciência de dados definam seus próprios esquemas e camadas de tratamento conforme a necessidade.
evoluir o Data Lake para um Data Lakehouse, incorporando tabelas transacionais (Dellalceberg/Hudi), governança via catálogo unificado e camadas de acesso otimizadas, permitindo atender simultaneamente consultas de Bl e cargas analíticas avançadas no mesmo repositório.
manter dois ambientes paralelos, com dados brutos no Data Lake e uma versão curada integral em um novo Data Warehouse moderno em nuvem, garantindo isolamento entre workloads, mesmo sem metadados unificados ou mecanismo de consistência entre os dois ambientes.
usar o Data Lake somente como staging e arquivamento, exigindo que Bl e modelos avançados sejam alimentados exclusivamente por data marts derivados do Data Warehouse, assegurando padronização total das estruturas analíticas, ainda que isso limite o uso direto de dados semiestruturados e experimento rápido em ciência de dados.