Sobes.tech
Middle — Senior

Izskaidrojiet skalētās punktuālās uzmanības formulu. Kāpēc dalīt ar sqrt(d_k)?

sobes.tech AI

Atbilde no AI

Skaļķotā punkta-reizējā uzmanība ir mehānisms, kas aprēķina svara koeficientus elementiem secībā, balstoties uz skalarajiem reizinājumiem starp pieprasījumiem (Q) un atslēgām (K). Formula ir šāda:

[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]

Šeit:

  • Q — pieprasījumu matrica,
  • K — atslēgu matrica,
  • V — vērtību matrica,
  • (d_k) — atslēgu vektoru dimensija.

Dalīšana ar (\sqrt{d_k}) ir nepieciešama, lai mērogotu skalarālo reizinājumu rezultātu. Bez šī soļa vērtības var kļūt pārāk lielas augstās dimensijās, kas noved pie ļoti lieliem argumentiem softmax funkcijā. Tas izraisa "gradientu izsīkšanas" problēmu — softmax kļūst ļoti "stingrs", gandrīz viens elements saņem 1 svaru, pārējie — gandrīz 0, kas pasliktina apmācību. Mērogošana stabilizē gradientus un uzlabo modeļa konverģenci.