Confronta i trasformatori pre-norm e post-norm. Quale è più stabile durante l'addestramento a profondità elevate?
sobes.tech AI
Risposta dell'AI
Pre-norm e post-norm sono due opzioni per la disposizione dello strato di normalizzazione (LayerNorm) nell'architettura del trasformatore.
-
Post-norm (versione originale di Vaswani et al., 2017): la normalizzazione viene applicata dopo il blocco di attenzione o FFN e dopo l'aggiunta della connessione residua.
-
Pre-norm: la normalizzazione viene applicata prima del blocco di attenzione o FFN, e la connessione residua viene aggiunta dopo.
Differenze e impatto sull'addestramento:
-
I trasformatori pre-norm sono generalmente più stabili durante l'addestramento in profondità (più strati). Ciò è dovuto al fatto che la normalizzazione prima del blocco aiuta a controllare meglio i gradienti e a prevenire la loro scomparsa o esplosione.
-
Nelle architetture post-norm, aumentando il numero di strati, spesso si verificano problemi con i gradienti, rendendo difficile l'addestramento di modelli profondi.
Conclusione: per i trasformatori profondi (ad esempio, più di 12 strati), è preferibile usare pre-norm, poiché garantisce un addestramento più stabile ed efficiente.