Salīdziniet pre-norm un post-norm transformatorus. Kurš ir stabilāks mācoties lielās dziļumos?
sobes.tech AI
Atbilde no AI
Pre-norm un post-norm ir ir divi varianti, kur normalizācijas slānis (LayerNorm) tiek izvietots transformatora arhitektūrā.
-
Post-norm (Vaswani un citi, 2017. gada oriģinālā versija): normalizācija tiek piemērota pēc uzmanības vai FFN bloka un pēc reziduālā savienojuma pievienošanas.
-
Pre-norm: normalizācija tiek piemērota pirms uzmanības vai FFN bloka, un reziduālais savienojums tiek pievienots pēc tam.
Atšķirības un ietekme uz apmācību:
-
Pre-norm transformatori parasti apgūst stabilākus ar lielāku dziļumu (vairāk slāņu). Tas ir saistīts ar to, ka normalizācija pirms bloka palīdz labāk kontrolēt gradientus un novērš to izzušanu vai sprādzienu.
-
Post-norm arhitektūrās, palielinot slāņu skaitu, bieži rodas gradientu problēmas, kas apgrūtina dziļu modeļu apmācību.
Secinājums: dziļiem transformatoriem (piemēram, vairāk nekā 12 slāņi) ir ieteicams izmantot pre-norm, jo tas nodrošina stabilāku un efektīvāku apmācību.