Weight tying дар байни embedding ва output projection чист?
sobes.tech AI
Ҷавоб аз AI
Тавреҳи вазнҳо як техника дар шабакаҳои нейронӣ аст, махсусан дар моделҳои коркарди забони табиӣ (масалан, трансформаторҳо), ки дар он вазнҳои қабати даргирӣ (embedding) ва қабати проексияи баромад (проексия ба луғат ҳангоми тавлиди матн) ҷудо мешаванд ва истифодаи ҳамон параметрҳоро мекунанд.
Ҳикоя ин аст, ки матрицаи вазн, ки индексҳои калимаҳоро ба векторҳо (embedding) табдил медиҳад, ва матрицаи, ки намояндагии дохилии моделро баргардонда ба эҳтимолиятҳои калимҳо (проексияи баромад), дар асл, алоқаманданд ва метавонанд якхела бошанд. Ин кам кардани шумораи параметрҳои модел ва беҳтар кардани қобилияти умумӣ мебошад.
Масалан: агар шумо матрицаи embedding бо андоза (vocab_size × embedding_dim) дошта бошед, қабати проексияи баромад метавонад истифодаи нусхаи транспонидашудаи ҳамин матрица барои ҳисоб кардани логитҳо пеш аз softmax.
Ин кӯмак мекунад:
- Кам кардани шумораи параметрҳо
- Беҳтар кардани ҳамоҳангӣ ва сифати модели
Дар трансформаторҳои классикӣ, мисли GPT, тавре ки вазнҳои пайвандӣ истифода мешаванд, одатан байни embedding-и вурудӣ ва қабати хаттии баромад истифода мешаванд.