Sobes.tech
Middle — Senior

Comparez les transformateurs pre-norm et post-norm. Lequel est plus stable lors de l'apprentissage à de grandes profondeurs?

sobes.tech IA

Réponse de l'IA

Pre-norm et post-norm sont deux options pour le placement de la couche de normalisation (LayerNorm) dans l'architecture du transformateur.

  • Post-norm (version originale de Vaswani et al., 2017) : la normalisation est appliquée après le bloc d'attention ou FFN et après l'ajout de la connexion résiduelle.

  • Pre-norm : la normalisation est appliquée avant le bloc d'attention ou FFN, et la connexion résiduelle est ajoutée après.

Différences et impact sur l'apprentissage :

  • Les transformateurs pre-norm sont généralement plus stables à entraîner en profondeur (plus de couches). Cela est dû au fait que la normalisation avant le bloc aide à mieux contrôler les gradients et à prévenir leur disparition ou explosion.

  • Dans l'architecture post-norm, en augmentant le nombre de couches, des problèmes de gradients apparaissent souvent, ce qui complique l'entraînement de modèles profonds.

Conclusion : pour les transformateurs profonds (par exemple, plus de 12 couches), il est préférable d'utiliser pre-norm, car il assure un entraînement plus stable et efficace.