Sobes.tech
Middle — Senior

Palyginkite pre-norm ir post-norm transformatorius. Kuris yra stabilesnis mokantis didelėse gyliose?

sobes.tech AI

Atsakymas iš AI

Pre-norm ir post-norm yra du variantai, kaip išdėstyti normalizacijos sluoksnį (LayerNorm) transformatoriaus architektūroje.

  • Post-norm (Vaswani ir kt., 2017 m. originali versija): normalizacija taikoma po dėmesio arba FFN bloko ir po rezidualinio ryšio pridėjimo.

  • Pre-norm: normalizacija taikoma prieš dėmesio arba FFN bloką, o rezidualinė jungtis pridedama po to.

Skirtumai ir poveikis mokymuisi:

  • Pre-norm transformatoriai paprastai mokosi stabilesnį didesnėse gylio lygiuose (daugiau sluoksnių). Tai susiję su tuo, kad normalizacija prieš bloką geriau kontroliuoja gradientus ir užkerta kelią jų nykimui ar sprogimui.

  • Post-norm architektūrose, didinant sluoksnių skaičių, dažnai kyla gradientų problemų, dėl ko sunkiau mokyti gilias modelius.

Išvada: gilūs transformatoriai (pvz., daugiau nei 12 sluoksnių) turėtų naudoti pre-norm, nes tai užtikrina stabilesnį ir efektyvesnį mokymąsi.