Vergelijk de pre-norm en post-norm transformers. Welke is stabieler tijdens training op grote diepten?
sobes.tech AI
Antwoord van AI
Pre-norm en post-norm zijn twee opties voor de plaatsing van de normalisatielaag (LayerNorm) in de transformer-architectuur.
-
Post-norm (de originele versie van Vaswani et al., 2017): normalisatie wordt toegepast na het aandacht- of FFN-blok en na de residual-verbinding.
-
Pre-norm: normalisatie wordt toegepast vóór het aandacht- of FFN-blok, en de residual-verbinding wordt erna toegevoegd.
Verschillen en invloed op training:
-
Pre-norm transformers worden over het algemeen stabieler getraind bij grotere diepten (meer lagen). Dit komt doordat normalisatie vóór het blok helpt om de gradiënten beter te controleren en te voorkomen dat ze verdwijnen of exploderen.
-
In post-norm architecturen ontstaan vaak problemen met gradiënten bij het toenemen van het aantal lagen, wat het trainen van diepe modellen bemoeilijkt.
Conclusie: voor diepe transformers (bijvoorbeeld meer dan 12 lagen) is het aan te raden pre-norm te gebruiken, omdat het een stabieler en efficiënter training mogelijk maakt.