Compare los transformadores pre-norm y post-norm. ¿Cuál es más estable durante el entrenamiento en profundidades mayores?
sobes.tech AI
Respuesta de la IA
Pre-norm y post-norm son dos opciones para la colocación de la capa de normalización (LayerNorm) en la arquitectura del transformador.
-
Post-norm (la opción original de Vaswani et al., 2017): la normalización se aplica después del bloque de atención o FFN y después de la adición de la conexión residual.
-
Pre-norm: la normalización se aplica antes del bloque de atención o FFN, y la conexión residual se añade después.
Diferencias y su impacto en el entrenamiento:
-
Los transformadores pre-norm generalmente se entrenan de manera más estable en profundidades mayores (más capas). Esto se debe a que la normalización antes del bloque ayuda a controlar mejor los gradientes y evita su desaparición o explosión.
-
En la arquitectura post-norm, al aumentar el número de capas, a menudo surgen problemas con los gradientes, lo que dificulta el entrenamiento de modelos profundos.
Conclusión: para transformadores profundos (por ejemplo, más de 12 capas), es preferible usar pre-norm, ya que proporciona un entrenamiento más estable y eficiente.