Sobes.tech
Middle — Senior

Compare los transformadores pre-norm y post-norm. ¿Cuál es más estable durante el entrenamiento en profundidades mayores?

sobes.tech AI

Respuesta de la IA

Pre-norm y post-norm son dos opciones para la colocación de la capa de normalización (LayerNorm) en la arquitectura del transformador.

  • Post-norm (la opción original de Vaswani et al., 2017): la normalización se aplica después del bloque de atención o FFN y después de la adición de la conexión residual.

  • Pre-norm: la normalización se aplica antes del bloque de atención o FFN, y la conexión residual se añade después.

Diferencias y su impacto en el entrenamiento:

  • Los transformadores pre-norm generalmente se entrenan de manera más estable en profundidades mayores (más capas). Esto se debe a que la normalización antes del bloque ayuda a controlar mejor los gradientes y evita su desaparición o explosión.

  • En la arquitectura post-norm, al aumentar el número de capas, a menudo surgen problemas con los gradientes, lo que dificulta el entrenamiento de modelos profundos.

Conclusión: para transformadores profundos (por ejemplo, más de 12 capas), es preferible usar pre-norm, ya que proporciona un entrenamiento más estable y eficiente.