Sobes.tech
Middle — Senior

Pre-norm və post-norm transformatorlarını müqayisə edin. Hansı daha böyük dərinliklərdə təlim zamanı daha stabildir?

sobes.tech Süni İntellekt

AI-dan cavab

Pre-norm və post-norm, transformator arxitekturasında normalizasiya qatının (LayerNorm) yerləşdirilməsi üçün iki variantdır.

  • Post-norm (Vaswani və digər, 2017-ci il orijinal versiya): normalizasiya diqqət və ya FFN blokundan sonra və qalıq əlaqəsinin əlavə olunmasından sonra tətbiq olunur.

  • Pre-norm: normalizasiya diqqət və ya FFN blokundan əvvəl tətbiq olunur və qalıq əlaqəsi sonra əlavə olunur.

Fərqlər və təlimə təsiri:

  • Pre-norm transformatorlar adətən daha dərin (daha çox qat) təlimdə daha stabildir. Bu, blokdan əvvəl normalizasiyanın gradientləri daha yaxşı idarə etməyə və onların yox olmasını və ya partlamasını qarşısını almağa kömək etməsindən irəli gəlir.

  • Post-norm arxitekturalarda, qatların sayı artırıldıqca, adətən gradient problemləri yaranır və bu, dərin modellərin təlimini çətinləşdirir.

Nəticə: dərin transformatorlar üçün (məsələn, 12-dən çox qat) pre-norm istifadə etmək üstünlükdür, çünki bu, daha stabilləşmiş və səmərəli təlim təmin edir.