Sobes.tech
Middle — Senior

Qu'est-ce que le pré-chauffage LN vs post-LN et quels sont les problèmes de convergence au début de l'entraînement?

sobes.tech IA

Réponse de l'IA

Pre-LN et Post-LN sont des variantes de l’emplacement de la couche de normalisation (Layer Normalization) dans l’architecture des transformateurs, influençant la stabilité et la convergence de l’apprentissage.

  • Post-LN (après la couche) : la normalisation est appliquée après le bloc d’attention et le feed-forward. C’est une approche classique, mais elle peut entraîner des problèmes de gradients au début de l’entraînement, ce qui rend la convergence difficile.

  • Pre-LN (avant la couche) : la normalisation est appliquée avant le bloc d’attention et le feed-forward. Cette approche améliore la stabilité des gradients et accélère la convergence, surtout aux premiers stades de l’entraînement.

Warmup est une augmentation progressive du taux d’apprentissage au début de l’entraînement, pour éviter des mises à jour brusques des poids et améliorer la convergence.

Les problèmes de convergence au début sont liés au fait que, sans warmup et avec Post-LN, les gradients peuvent être trop grands ou trop petits, ce qui entrave un apprentissage efficace. Pre-LN avec warmup aide à atténuer ces problèmes, assurant un entraînement plus stable et plus rapide des transformateurs.