Sobes.tech
Middle — Senior

Hasonlítsa össze a pre-norm és post-norm transzformereket. Melyik stabilabb nagyobb mélységekben történő tanulás során?

sobes.tech MI

Válasz az MI-től

Pre-norm és post-norm két lehetőség a normalizációs réteg (LayerNorm) elhelyezésére a transzformer architektúrában.

  • Post-norm (Vaswani et al., 2017 eredeti változat): a normalizációt a figyelem vagy FFN blokk után és a maradék összeköttetés hozzáadása után alkalmazzuk.

  • Pre-norm: a normalizációt a figyelem vagy FFN blokk előtt alkalmazzuk, és a maradék összeköttetés után adódik hozzá.

Különbségek és hatás a tanulásra:

  • A pre-norm transzformerek általában stabilabban tanulnak nagyobb mélységben (több réteggel). Ez azért van, mert a blokk előtti normalizáció jobban ellenőrzi a gradiensokat, és megakadályozza azok eltűnését vagy robbanását.

  • A post-norm architektúrákban a rétegszám növelésével gyakran problémák adódnak a gradiensekkel, ami megnehezíti a mély modellek tanítását.

Következtetés: mély transzformerekhez (pl. több mint 12 réteg) előnyösebb a pre-norm használata, mivel stabilabb és hatékonyabb tanulást biztosít.