Pre-norm va post-norm transformatorlarini solishtiring. Qaysi biri katta chuqurliklarda o'qitishda barqarorroq?
sobes.tech AI
AIdan javob
Pre-norm va post-norm transformator arxitekturasida normalizatsiya qatlamining (LayerNorm) joylashuvi uchun ikki variantdir.
-
Post-norm (Vaswani va boshqalar, 2017 yil original versiya): normalizatsiya e'tibor yoki FFN blokidan keyin va qoldiq ulanish qo'shilgandan so'ng qo'llaniladi.
-
Pre-norm: normalizatsiya e'tibor yoki FFN blokidan oldin qo'llaniladi, va qoldiq ulanish keyin qo'shiladi.
Farqlar va o'qitishga ta'siri:
-
Pre-norm transformatorlar odatda chuqurlikda (ko'proq qatlamlar) barqarorroq o'qitiladi. Bu, blokdan oldin normalizatsiya gradientlarni yaxshiroq nazorat qilishga va ularning yo'qolishi yoki portlashini oldini olishga yordam berishi bilan bog'liq.
-
Post-norm arxitekturalarda, qatlamlar soni oshgani sayin, odatda gradient muammolari yuzaga keladi, bu chuqur modellarni o'qitishni qiyinlashtiradi.
Xulosa: chuqur transformatorlar uchun (masalan, 12 dan ortiq qatlamlar) pre-normni ishlatish afzaldir, chunki u barqarorroq va samarali o'qitishni ta'minlaydi.