Porovnejte pre-norm a post-norm transformátory. Který je stabilnější při učení na velkých hloubkách?
sobes.tech AI
Odpověď od AI
Pre-norm a post-norm jsou dvě možnosti umístění vrstvy normalizace (LayerNorm) v architektuře transformátoru.
-
Post-norm (původní verze od Vaswani et al., 2017): normalizace se aplikuje po bloku pozornosti nebo FFN a po přidání reziduálního spojení.
-
Pre-norm: normalizace se aplikuje před blokem pozornosti nebo FFN a reziduální spojení se přidává po něm.
Rozdíly a vliv na učení:
-
Pre-norm transformery se obvykle učí stabilněji při větších hloubkách (více vrstev). To je způsobeno tím, že normalizace před blokem lépe kontroluje gradienty a zabraňuje jejich zániku nebo výbuchu.
-
V architektuře post-norm se při zvyšování počtu vrstev často objevují problémy s gradienty, což ztěžuje učení hlubokých modelů.
Závěr: pro hluboké transformery (například více než 12 vrstev) je vhodnější používat pre-norm, protože zajišťuje stabilnější a efektivnější učení.