Sobes.tech
Middle — Senior

Porovnajte pre-norm a post-norm transformátory. Ktorý je stabilnejší pri učení na veľkých hĺbkach?

sobes.tech AI

Odpoveď od AI

Pre-norm a post-norm sú dve možnosti umiestnenia vrstvy normalizácie (LayerNorm) v architektúre transformátora.

  • Post-norm (pôvodná verzia od Vaswani et al., 2017): normalizácia sa aplikuje po bloku pozornosti alebo FFN a po pridaní reziduálneho spojenia.

  • Pre-norm: normalizácia sa aplikuje pred blokom pozornosti alebo FFN a reziduálne spojenie sa pridáva po ňom.

Rozdiely a vplyv na učenie:

  • Pre-norm transformery sa zvyčajne učia stabilnejšie pri väčších hĺbkach (viac vrstiev). To je spôsobené tým, že normalizácia pred blokom lepšie kontroluje gradienty a zabraňuje ich zániku alebo výbuchu.

  • V architektúre post-norm sa pri zvyšovaní počtu vrstiev často objavujú problémy s gradientmi, čo sťažuje učenie hlbokých modelov.

Záver: pre hlboké transformery (napríklad viac ako 12 vrstiev) je vhodnejšie používať pre-norm, pretože zabezpečuje stabilnejšie a efektívnejšie učenie.