Sobes.tech
Middle — Senior

Co je to weight tying mezi embeddingem a výstupní projekcí?

sobes.tech AI

Odpověď od AI

Vázání vah je technika v neuronových sítích, zejména v modelech pro zpracování přirozeného jazyka (například transformátorech), kdy jsou váhy vrstvy vložení (embedding) a vrstvy projekce výstupu (projekce na slovník při generování textu) odděleny a používají stejné parametry.

Myšlenka je, že matice vah, která převádí vstupní indexy slov na vektory (embedding), a matice, která převádí vnitřní reprezentaci modelu zpět na pravděpodobnosti slov (projekce výstupu), jsou ve skutečnosti propojené a mohou být stejné. To snižuje počet parametrů modelu a zlepšuje schopnost generalizace.

Příklad: pokud máte matici vložení velikosti (vocab_size × embedding_dim), může vrstva projekce výstupu použít transponovanou verzi této matice k výpočtu logitů před softmaxem.

To pomáhá:

  • Snížit počet parametrů
  • Zlepšit konvergenci a kvalitu modelu

U klasických transformátorů, jako je GPT, se váhové vazby často používají mezi vstupním vložením a výstupní lineární vrstvou.