Comparez les transformateurs pre-norm et post-norm. Lequel est plus stable lors de l'apprentissage à de grandes profondeurs?
sobes.tech IA
Réponse de l'IA
Pre-norm et post-norm sont deux options pour le placement de la couche de normalisation (LayerNorm) dans l'architecture du transformateur.
-
Post-norm (version originale de Vaswani et al., 2017) : la normalisation est appliquée après le bloc d'attention ou FFN et après l'ajout de la connexion résiduelle.
-
Pre-norm : la normalisation est appliquée avant le bloc d'attention ou FFN, et la connexion résiduelle est ajoutée après.
Différences et impact sur l'apprentissage :
-
Les transformateurs pre-norm sont généralement plus stables à entraîner en profondeur (plus de couches). Cela est dû au fait que la normalisation avant le bloc aide à mieux contrôler les gradients et à prévenir leur disparition ou explosion.
-
Dans l'architecture post-norm, en augmentant le nombre de couches, des problèmes de gradients apparaissent souvent, ce qui complique l'entraînement de modèles profonds.
Conclusion : pour les transformateurs profonds (par exemple, plus de 12 couches), il est préférable d'utiliser pre-norm, car il assure un entraînement plus stable et efficace.