Imagem de fundo

O artigo Attention is All You Need (Vaswani et al., 2017) marcou uma ruptura no process...

O artigo Attention is All You Need (Vaswani et al., 2017) marcou uma ruptura no processamento de linguagem natural ao apresentar a arquitetura Transformer. Sua abordagem abriu caminho para a criação de modelos de grande escala, como BERT, GPT e diversos outros que dominam o estado da arte em processamento de linguagem natural e em outras áreas, como visão computacional e bioinformática.


Sobre a arquitetura Transformer, é correto afirmar que:


A

o Transformer substitui mecanismos recorrentes por atenção, mas não utiliza codificação posicional, pois o alinhamento sequencial é aprendido implicitamente pelas cabeças de atenção;


B

a introdução do multi-head attention permite ao modelo aprender relações diferentes entre tokens em subespaços de projeção distintos, preservando a informação posicional por meio de codificadores específicos;


C

o Transformer original evita camadas feed-foward densas para reduzir a complexidade, compensando essa ausência com mais cabeças de atenção por bloco;


D

o mecanismo de scaled dot-product attention multiplica os escores de similaridade pela raiz quadrada da dimensão das keys para intensificar as diferenças entre tokens distantes;


E

a arquitetura de encoder-decoder é composta por blocos distintos no encoder e no decoder, sem reutilização estrutural, a fim de especializar cada parte para tarefas diferentes.