

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Uma Secretaria da Fazenda Estadual recebeu uma base de dados contendo 2,3 milhões de registros de declarações fiscais para análise de conformidade tributária. Durante a fase de exploração inicial, a equipe técnica identificou diversos problemas: campos de CNPJ com formatações inconsistentes (alguns com pontuação, outros sem), valores monetários registrados com separadores decimais divergentes (vírgula e ponto), datas em formatos distintos (DD/MM/AAMA, AMAA-MM-DD), campos obrigatórios vazios em aproximadamente 12% dos registros, e a presença de valores extremos de receita bruta (outliers) que distorciam as análises estatísticas. Além disso, a variável "regime tributário" apresentava categorias redundantes devido a erros de digitação (ex “Simples Nacional”, “SIMPLES NACIONAL”, “Simples nacional). Para viabilizar a análise de risco fiscal e a construção de modelos preditivos, tomou-se necessário aplicar técnicas sistemáticas de preparação dos dados antes do processamento analítico. Considerando as melhores práticas de pré-processamento de dados, o tratamento correto e adequado para essa situação é
aplicar tokenização em campos textuais para fragmentar as informações em unidades menores, utilização de técnicas de stemming e lemmatização para uniformizar as categorias de regime tributário, implementação de métodos de detecção de anomalias baseados em Isolation Forest para identificar registros fiscais suspeitos e preenchimento de valores ausentes mediante algoritmos de interpolação linear ou polinomial, assegurando a completude da base de dados para processamento posterior.
iniciar com a aplicação de técnicas de feature scaling através de padronização z-score em todas as variáveis numéricas para centralizá-las em média zero e desvio padrão unitário, seguida de codificação ordinal para variáveis categóricas respeitando hierarquias naturais, detecção de outliers multivariados mediante distância de Mahalanobis e imputação de dados faltantes exclusivamente por valores constantes predefinidos conforme regras de negócio tributário, evitando métodos estatísticos que alterem distribuições originais.
priorizar, inicialmente, a exclusão automática de todos os registros que apresentem campos obrigatórios vazios, seguida da aplicação de técnicas de winsorização para substituir valores extremos pelos percentis 5 e 95, padronização das strings mediante conversão para maiúsculas e remoção de acentuação, garantindo assim a integridade da base sem necessidade de imputação de dados faltantes que poderia introduzir viés nas análises tributárias.
aplicar técnicas de normalização min-max em todas as variáveis numéricas para escaloná-las entre 0 e 1, realizar a codificação one-hot encoding nas variáveis categóricas, incluindo a variável regime tributário, implementar detecção de outliers através do método de Tukey (I0R) com remoção automática dos valores identificados e utilizar forward fill para preencher dados faltantes sequencialmente, preservando a ordenação temporal dos registros fiscais.
padronizar formatos mediante expressões regulares para unificar CNPJ, valores monetários e datas em padrões consistentes, tratamento de dados faltantes atraves de análise contextual para decidir entre imputação (por média, mediana ou algoritmos como KNN) ou exclusão baseada em criticidade; normalização de texto com conversão para caixa baixa, remoção de espaços extras para eliminar duplicatas categóricas; e análise criteriosa de outliers distinguindo valores legítimos de erros de registro antes de qualquer ação corretiva.