Sobes.tech
Middle — Senior

Porovnejte pre-norm a post-norm transformátory. Který je stabilnější při učení na velkých hloubkách?

sobes.tech AI

Odpověď od AI

Pre-norm a post-norm jsou dvě možnosti umístění vrstvy normalizace (LayerNorm) v architektuře transformátoru.

  • Post-norm (původní verze od Vaswani et al., 2017): normalizace se aplikuje po bloku pozornosti nebo FFN a po přidání reziduálního spojení.

  • Pre-norm: normalizace se aplikuje před blokem pozornosti nebo FFN a reziduální spojení se přidává po něm.

Rozdíly a vliv na učení:

  • Pre-norm transformery se obvykle učí stabilněji při větších hloubkách (více vrstev). To je způsobeno tím, že normalizace před blokem lépe kontroluje gradienty a zabraňuje jejich zániku nebo výbuchu.

  • V architektuře post-norm se při zvyšování počtu vrstev často objevují problémy s gradienty, což ztěžuje učení hlubokých modelů.

Závěr: pro hluboké transformery (například více než 12 vrstev) je vhodnější používat pre-norm, protože zajišťuje stabilnější a efektivnější učení.