Sobes.tech
Middle — Senior

Pre-norm жана post-norm трансформерлерин салыштырып көрүңүз. Кайсысы чоң тереңдиктерде үйрөнүүдө туруктуураак?

sobes.tech AI

AIден жооп

Pre-norm жана post-norm трансформатор архитектурасында нормализация катмарынын (LayerNorm) жайгашуусу үчүн эки вариант бар.

  • Post-norm (Vaswani жана башка, 2017-жылдагы оригинал версиясы): нормализация көңүл буруу же FFN блокунан кийин жана калдык байланыш кошулгандан кийин колдонулат.

  • Pre-norm: нормализация көңүл буруу же FFN блокунан мурда колдонулат, жана калдык байланыш андан кийин кошулат.

Айлана-чөйрө жана үйрөнүүгө таасири:

  • Pre-norm трансформаторлору көбүрөөк катмары бар (азыркы учурда 12ден ашык) үйрөнүүдө көбүрөөк туруктуу болот. Бул блоктун алдында нормализация градиенттерди жакшыраак көзөмөлдөөгө жана алардын жоголушу же жарылуусун алдын алууга жардам берет.

  • Post-norm архитектураларында, катмардын саны көбөйгөн сайын, градиент маселелери пайда болуп, терең моделдерди үйрөтүү кыйынчылыкка дуушар болот.

Жыйынтык: терең трансформаторлор үчүн (мисалы, 12ден ашык катмары бар) pre-norm колдонуу артыкчылыктуу, анткени ал туруктуу жана натыйжалуу үйрөнүүнү камсыздайт.