

Seu próximo nível começa aqui
Seu desenvolvimento não pode ter limites. Garanta sua Assinatura Ilimitada e libere uma preparação completa com os melhores professores do Brasil.
No treinamento de grandes modelos de linguagem (LLMs), como o GPT-4, uma técnica importante, utilizada para estabilizar o treinamento e favorecer a convergência - especialmente ao lidar com camadas profundas -, é a normalização por camada, conhecida como Layer Normalization, que consiste em:
normalizar as ativações ao longo dos canais de entrada, reduzindo o desvio padrão espacial, ideal para modelos CNN.
realizar a normalização entre exemplos de treinamento, reduzindo a variação das ativações dentro de um mesmo lote.
normalizar as ativações individualmente para cada exemplo, considerando todos os neurônios da mesma camada.
aplicar uma normalização nas ativações por meio de uma média móvel das ativações das camadas anteriores.
realizar uma normalização baseada em gradientes acumulados, diretamente no passo de retropropagação (backpropagation).