Hasonlítsa össze a pre-norm és post-norm transzformereket. Melyik stabilabb nagyobb mélységekben történő tanulás során?
sobes.tech MI
Válasz az MI-től
Pre-norm és post-norm két lehetőség a normalizációs réteg (LayerNorm) elhelyezésére a transzformer architektúrában.
-
Post-norm (Vaswani et al., 2017 eredeti változat): a normalizációt a figyelem vagy FFN blokk után és a maradék összeköttetés hozzáadása után alkalmazzuk.
-
Pre-norm: a normalizációt a figyelem vagy FFN blokk előtt alkalmazzuk, és a maradék összeköttetés után adódik hozzá.
Különbségek és hatás a tanulásra:
-
A pre-norm transzformerek általában stabilabban tanulnak nagyobb mélységben (több réteggel). Ez azért van, mert a blokk előtti normalizáció jobban ellenőrzi a gradiensokat, és megakadályozza azok eltűnését vagy robbanását.
-
A post-norm architektúrákban a rétegszám növelésével gyakran problémák adódnak a gradiensekkel, ami megnehezíti a mély modellek tanítását.
Következtetés: mély transzformerekhez (pl. több mint 12 réteg) előnyösebb a pre-norm használata, mivel stabilabb és hatékonyabb tanulást biztosít.