Sobes.tech
Middle — Senior

Compare os transformadores pre-norm e post-norm. Qual deles é mais estável durante o treino em profundidades maiores?

sobes.tech IA

Resposta da IA

Pre-norm e post-norm são duas opções para a colocação da camada de normalização (LayerNorm) na arquitetura do transformador.

  • Post-norm (versão original de Vaswani et al., 2017): a normalização é aplicada após o bloco de atenção ou FFN e após a adição da conexão residual.

  • Pre-norm: a normalização é aplicada antes do bloco de atenção ou FFN, e a conexão residual é adicionada depois.

Diferenças e impacto no treinamento:

  • Transformadores pre-norm geralmente treinam de forma mais estável em profundidades maiores (mais camadas). Isso ocorre porque a normalização antes do bloco ajuda a controlar melhor os gradientes e evita sua dissipação ou explosão.

  • Na arquitetura post-norm, ao aumentar o número de camadas, frequentemente surgem problemas com os gradientes, dificultando o treinamento de modelos profundos.

Conclusão: para transformadores profundos (por exemplo, mais de 12 camadas), é preferível usar pre-norm, pois garante um treinamento mais estável e eficiente.