Sobes.tech
Middle — Senior

Трансформерҳои pre-norm ва post-norm-ро муқоиса кунед. Кадомаш дар омӯзиш дар амиқии калон устувортар аст?

sobes.tech AI

Ҷавоб аз AI

Pre-norm ва post-norm трансформатор архитектурасида нормализация қатламининг (LayerNorm) жойлашувининг икки вариантидир.

  • Post-norm (Vaswani ва бошқалар, 2017 йил оригинал версияси): нормализация диққат ёки FFN блокидан кейин ва қўшимча қолдириш ёки қолдириш қўшилгандан кейин қўлланилади.

  • Pre-norm: нормализация диққат ёки FFN блокидан олдин қўлланилади, ва қолдириш қўшилгандан кейин қўшилади.

Фарқлар ва ўқитишга таъсири:

  • Pre-norm трансформаторлар одатда катта чуқурликда (кўпроқ қатламлар) барқарорроқ ўқитилади. Бу блокдан олдин нормализация градиентларни яхшироқ назорат қилишга ва уларнинг йўқолиши ёки портлашини олдини олишга ёрдам беради.

  • Post-norm архитектураларида, қатламлар сони оширилганда, одатда градиент муаммолари юзага келади, бу эса чуқур моделларни ўқитишни қийинлаштиради.

Хулоса: чуқур трансформерлар учун (масалан, 12 дан ортиқ қатламлар) pre-normдан фойдаланиш афзал, чунки у барқарор ва самарали ўқитишни таъминлайди.