Pre-norm ve post-norm dönüştürücüleri karşılaştırın. Hangisi daha derinlerde eğitim sırasında daha stabil?
sobes.tech yapay zeka
AI'dan gelen yanıt
Pre-norm ve post-norm, dönüştürücü mimarisinde normalizasyon katmanı (LayerNorm) yerleştirme seçenekleridir.
-
Post-norm (Vaswani ve diğerleri, 2017 orijinal versiyon): normalizasyon, dikkat veya FFN bloğundan sonra ve kalan bağlantı eklemesinden sonra uygulanır.
-
Pre-norm: normalizasyon, dikkat veya FFN bloğundan önce uygulanır ve kalan bağlantı sonra eklenir.
Farklar ve eğitim üzerindeki etkileri:
-
Pre-norm dönüştürücüleri genellikle daha derin (daha fazla katman) eğitimde daha stabildir. Bu, bloğun öncesinde normalizasyonun gradyanları daha iyi kontrol etmeye ve onların kaybolmasını veya patlamasını önlemeye yardımcı olmasından kaynaklanır.
-
Post-norm mimarilerde, katman sayısı arttıkça, genellikle gradyan sorunları ortaya çıkar ve bu da derin modellerin eğitimini zorlaştırır.
Sonuç: Daha derin dönüştürücüler (örneğin, 12'den fazla katman) için pre-norm kullanmak tercih edilir, çünkü daha stabil ve verimli bir eğitim sağlar.