Middle — Senior
Izskaidrojiet skalētās punktuālās uzmanības formulu. Kāpēc dalīt ar sqrt(d_k)?
sobes.tech AI
Atbilde no AI
Skaļķotā punkta-reizējā uzmanība ir mehānisms, kas aprēķina svara koeficientus elementiem secībā, balstoties uz skalarajiem reizinājumiem starp pieprasījumiem (Q) un atslēgām (K). Formula ir šāda:
[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]
Šeit:
- Q — pieprasījumu matrica,
- K — atslēgu matrica,
- V — vērtību matrica,
- (d_k) — atslēgu vektoru dimensija.
Dalīšana ar (\sqrt{d_k}) ir nepieciešama, lai mērogotu skalarālo reizinājumu rezultātu. Bez šī soļa vērtības var kļūt pārāk lielas augstās dimensijās, kas noved pie ļoti lieliem argumentiem softmax funkcijā. Tas izraisa "gradientu izsīkšanas" problēmu — softmax kļūst ļoti "stingrs", gandrīz viens elements saņem 1 svaru, pārējie — gandrīz 0, kas pasliktina apmācību. Mērogošana stabilizē gradientus un uzlabo modeļa konverģenci.