

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
Uma secretaria de fazenda estadual recebe diariamente milhões de notas fiscais eletrônicas (NF-e). Um desafio central da fiscalização é validar se a descrição textual dos itens comercializados é condizente com o código NCM (nomenclatura comum do Mercosul) declarado. Para automatizar essa classificação semântica em larga escala, utiliza-se processamento de linguagem natural (PLN) e redes neurais.
Assinale a opção em que são apresentadas a técnica adequada para esse cenário e sua descrição.
Lemmatization — método de agrupamento não supervisionado (clustering) que organiza descrições de mercadorias por similaridade, prescindindo de rótulos de treinamento para a classificação fiscal
stemming — técnica de redução morfológica que mapeia palavras para vetores numéricos densos, preservando a semântica contextual completa do item fiscal
word embeddings — representações vetoriais de palavras em um espaço contínuo, em que termos semanticamente semelhantes são projetados em posições próximas (baixa distância vetorial), facilitando a identificação de sinônimos na descrição dos produtos
arquiteturas transformer — modelos baseados no mecanismo de atenção (attention), capazes de capturar dependências contextuais e relações de longo alcance entre os termos de uma descrição, sendo altamente eficazes para a tarefa de classificação de texto e compatibilização com a NCM
tokenização — processo de detecção de anomalias sintáticas que substitui a necessidade de modelos preditivos ao identificar erros de digitação em documentos fiscais