Porovnajte pre-norm a post-norm transformátory. Ktorý je stabilnejší pri učení na veľkých hĺbkach?
sobes.tech AI
Odpoveď od AI
Pre-norm a post-norm sú dve možnosti umiestnenia vrstvy normalizácie (LayerNorm) v architektúre transformátora.
-
Post-norm (pôvodná verzia od Vaswani et al., 2017): normalizácia sa aplikuje po bloku pozornosti alebo FFN a po pridaní reziduálneho spojenia.
-
Pre-norm: normalizácia sa aplikuje pred blokom pozornosti alebo FFN a reziduálne spojenie sa pridáva po ňom.
Rozdiely a vplyv na učenie:
-
Pre-norm transformery sa zvyčajne učia stabilnejšie pri väčších hĺbkach (viac vrstiev). To je spôsobené tým, že normalizácia pred blokom lepšie kontroluje gradienty a zabraňuje ich zániku alebo výbuchu.
-
V architektúre post-norm sa pri zvyšovaní počtu vrstiev často objavujú problémy s gradientmi, čo sťažuje učenie hlbokých modelov.
Záver: pre hlboké transformery (napríklad viac ako 12 vrstiev) je vhodnejšie používať pre-norm, pretože zabezpečuje stabilnejšie a efektívnejšie učenie.