Imagem de fundo

Uma secretaria de fazenda estadual recebe diariamente milhões de notas fiscais eletrôn...

Uma secretaria de fazenda estadual recebe diariamente milhões de notas fiscais eletrônicas (NF-e). Um desafio central da fiscalização é validar se a descrição textual dos itens comercializados é condizente com o código NCM (nomenclatura comum do Mercosul) declarado. Para automatizar essa classificação semântica em larga escala, utiliza-se processamento de linguagem natural (PLN) e redes neurais.


Assinale a opção em que são apresentadas a técnica adequada para esse cenário e sua descrição.


A

Lemmatization — método de agrupamento não supervisionado (clustering) que organiza descrições de mercadorias por similaridade, prescindindo de rótulos de treinamento para a classificação fiscal


B

stemming — técnica de redução morfológica que mapeia palavras para vetores numéricos densos, preservando a semântica contextual completa do item fiscal


C

word embeddings — representações vetoriais de palavras em um espaço contínuo, em que termos semanticamente semelhantes são projetados em posições próximas (baixa distância vetorial), facilitando a identificação de sinônimos na descrição dos produtos


D

arquiteturas transformer — modelos baseados no mecanismo de atenção (attention), capazes de capturar dependências contextuais e relações de longo alcance entre os termos de uma descrição, sendo altamente eficazes para a tarefa de classificação de texto e compatibilização com a NCM


E

tokenização — processo de detecção de anomalias sintáticas que substitui a necessidade de modelos preditivos ao identificar erros de digitação em documentos fiscais