Selgitage skaleeritud punktuaalse tähelepanu valemit. Miks jagada sqrt(d_k)-ga?
sobes.tech AI
Vastus AI-lt
Skalaarne punkt-keermega tähelepanu on tähelepanu mehhanism, mis arvutab kaalukordajad seeria elementidele, põhinedes küsimuste (Q) ja võtmete (K) skalaarkorrutistel. Valem näeb välja järgmine:
[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]
Siin:
- Q — küsimuste maatriks,
- K — võtmete maatriks,
- V — väärtuste maatriks,
- (d_k) — võtme vektorite mõõt.
Jagamine (\sqrt{d_k}) abil on vajalik skalaarkorrutise tulemuse skaleerimiseks. Ilma selle sammuta võivad väärtused kõrgetes mõõtmetes muutuda liiga suurteks, mis põhjustab väga suuri argumente softmax funktsioonis. See põhjustab "gradiente, mis hajuvad" probleemi — softmax muutub väga "rangeks", peaaegu üks element saab kaalu 1, ülejäänud peaaegu 0, mis halvendab õppimist. Skaalumine stabiliseerib gradientide väärtusi ja parandab mudeli konvergentsi.