Sobes.tech
Middle — Senior

Porównaj transformery pre-norm i post-norm. Który jest bardziej stabilny podczas uczenia się na dużych głębokościach?

sobes.tech AI

Odpowiedź od AI

Pre-norm i post-norm to dwie opcje umieszczenia warstwy normalizacji (LayerNorm) w architekturze transformera.

  • Post-norm (oryginalna wersja Vaswani i in., 2017): normalizacja jest stosowana po bloku uwagi lub FFN i po dodaniu połączenia resztkowego.

  • Pre-norm: normalizacja jest stosowana przed blokiem uwagi lub FFN, a połączenie resztkowe jest dodawane po nim.

Różnice i wpływ na uczenie:

  • Transformery pre-norm zwykle uczą się stabilniej na większych głębokościach (więcej warstw). Wynika to z faktu, że normalizacja przed blokiem pomaga lepiej kontrolować gradienty i zapobiega ich zanikowi lub eksplozji.

  • W architekturze post-norm, przy zwiększaniu liczby warstw, często pojawiają się problemy z gradientami, co utrudnia uczenie głębokich modeli.

Wniosek: dla głębokich transformerów (np. więcej niż 12 warstw) lepiej jest używać pre-norm, ponieważ zapewnia to bardziej stabilne i efektywne uczenie.