Porównaj transformery pre-norm i post-norm. Który jest bardziej stabilny podczas uczenia się na dużych głębokościach?
sobes.tech AI
Odpowiedź od AI
Pre-norm i post-norm to dwie opcje umieszczenia warstwy normalizacji (LayerNorm) w architekturze transformera.
-
Post-norm (oryginalna wersja Vaswani i in., 2017): normalizacja jest stosowana po bloku uwagi lub FFN i po dodaniu połączenia resztkowego.
-
Pre-norm: normalizacja jest stosowana przed blokiem uwagi lub FFN, a połączenie resztkowe jest dodawane po nim.
Różnice i wpływ na uczenie:
-
Transformery pre-norm zwykle uczą się stabilniej na większych głębokościach (więcej warstw). Wynika to z faktu, że normalizacja przed blokiem pomaga lepiej kontrolować gradienty i zapobiega ich zanikowi lub eksplozji.
-
W architekturze post-norm, przy zwiększaniu liczby warstw, często pojawiają się problemy z gradientami, co utrudnia uczenie głębokich modeli.
Wniosek: dla głębokich transformerów (np. więcej niż 12 warstw) lepiej jest używać pre-norm, ponieważ zapewnia to bardziej stabilne i efektywne uczenie.