Palyginkite pre-norm ir post-norm transformatorius. Kuris yra stabilesnis mokantis didelėse gyliose?
sobes.tech AI
Atsakymas iš AI
Pre-norm ir post-norm yra du variantai, kaip išdėstyti normalizacijos sluoksnį (LayerNorm) transformatoriaus architektūroje.
-
Post-norm (Vaswani ir kt., 2017 m. originali versija): normalizacija taikoma po dėmesio arba FFN bloko ir po rezidualinio ryšio pridėjimo.
-
Pre-norm: normalizacija taikoma prieš dėmesio arba FFN bloką, o rezidualinė jungtis pridedama po to.
Skirtumai ir poveikis mokymuisi:
-
Pre-norm transformatoriai paprastai mokosi stabilesnį didesnėse gylio lygiuose (daugiau sluoksnių). Tai susiję su tuo, kad normalizacija prieš bloką geriau kontroliuoja gradientus ir užkerta kelią jų nykimui ar sprogimui.
-
Post-norm architektūrose, didinant sluoksnių skaičių, dažnai kyla gradientų problemų, dėl ko sunkiau mokyti gilias modelius.
Išvada: gilūs transformatoriai (pvz., daugiau nei 12 sluoksnių) turėtų naudoti pre-norm, nes tai užtikrina stabilesnį ir efektyvesnį mokymąsi.