Sobes.tech
Middle — Senior

Comparați transformatoarele pre-norm și post-norm. Care este mai stabil în timpul antrenamentului la adâncimi mari?

sobes.tech AI

Răspuns de la AI

Pre-norm și post-norm sunt două opțiuni pentru plasarea stratului de normalizare (LayerNorm) în arhitectura transformer.

  • Post-norm (versiunea originală de Vaswani et al., 2017): normalizarea se aplică după blocul de atenție sau FFN și după adăugarea conexiunii reziduale.

  • Pre-norm: normalizarea se aplică înainte de blocul de atenție sau FFN, iar conexiunea reziduală este adăugată după.

Diferențe și impact asupra antrenamentului:

  • Transformatoarele pre-norm sunt de obicei mai stabile în antrenament la adâncimi mai mari (mai multe straturi). Acest lucru se datorează faptului că normalizarea înainte de bloc ajută la controlul mai bun al gradientelor și previne dispariția sau explozia acestora.

  • În arhitectura post-norm, creșterea numărului de straturi duce adesea la probleme cu gradientele, ceea ce face dificil antrenamentul modelelor profunde.

Concluzie: pentru transformatoare adânci (de exemplu, mai mult de 12 straturi), este preferabil să se utilizeze pre-norm, deoarece asigură un antrenament mai stabil și mai eficient.