Sobes.tech
Middle — Senior

Confronta i trasformatori pre-norm e post-norm. Quale è più stabile durante l'addestramento a profondità elevate?

sobes.tech AI

Risposta dell'AI

Pre-norm e post-norm sono due opzioni per la disposizione dello strato di normalizzazione (LayerNorm) nell'architettura del trasformatore.

  • Post-norm (versione originale di Vaswani et al., 2017): la normalizzazione viene applicata dopo il blocco di attenzione o FFN e dopo l'aggiunta della connessione residua.

  • Pre-norm: la normalizzazione viene applicata prima del blocco di attenzione o FFN, e la connessione residua viene aggiunta dopo.

Differenze e impatto sull'addestramento:

  • I trasformatori pre-norm sono generalmente più stabili durante l'addestramento in profondità (più strati). Ciò è dovuto al fatto che la normalizzazione prima del blocco aiuta a controllare meglio i gradienti e a prevenire la loro scomparsa o esplosione.

  • Nelle architetture post-norm, aumentando il numero di strati, spesso si verificano problemi con i gradienti, rendendo difficile l'addestramento di modelli profondi.

Conclusione: per i trasformatori profondi (ad esempio, più di 12 strati), è preferibile usare pre-norm, poiché garantisce un addestramento più stabile ed efficiente.