Трансформерҳои pre-norm ва post-norm-ро муқоиса кунед. Кадомаш дар омӯзиш дар амиқии калон устувортар аст?
sobes.tech AI
Ҷавоб аз AI
Pre-norm ва post-norm трансформатор архитектурасида нормализация қатламининг (LayerNorm) жойлашувининг икки вариантидир.
-
Post-norm (Vaswani ва бошқалар, 2017 йил оригинал версияси): нормализация диққат ёки FFN блокидан кейин ва қўшимча қолдириш ёки қолдириш қўшилгандан кейин қўлланилади.
-
Pre-norm: нормализация диққат ёки FFN блокидан олдин қўлланилади, ва қолдириш қўшилгандан кейин қўшилади.
Фарқлар ва ўқитишга таъсири:
-
Pre-norm трансформаторлар одатда катта чуқурликда (кўпроқ қатламлар) барқарорроқ ўқитилади. Бу блокдан олдин нормализация градиентларни яхшироқ назорат қилишга ва уларнинг йўқолиши ёки портлашини олдини олишга ёрдам беради.
-
Post-norm архитектураларида, қатламлар сони оширилганда, одатда градиент муаммолари юзага келади, бу эса чуқур моделларни ўқитишни қийинлаштиради.
Хулоса: чуқур трансформерлар учун (масалан, 12 дан ортиқ қатламлар) pre-normдан фойдаланиш афзал, чунки у барқарор ва самарали ўқитишни таъминлайди.