Sobes.tech
Middle — Senior

Selgitage skaleeritud punktuaalse tähelepanu valemit. Miks jagada sqrt(d_k)-ga?

sobes.tech AI

Vastus AI-lt

Skalaarne punkt-keermega tähelepanu on tähelepanu mehhanism, mis arvutab kaalukordajad seeria elementidele, põhinedes küsimuste (Q) ja võtmete (K) skalaarkorrutistel. Valem näeb välja järgmine:

[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]

Siin:

  • Q — küsimuste maatriks,
  • K — võtmete maatriks,
  • V — väärtuste maatriks,
  • (d_k) — võtme vektorite mõõt.

Jagamine (\sqrt{d_k}) abil on vajalik skalaarkorrutise tulemuse skaleerimiseks. Ilma selle sammuta võivad väärtused kõrgetes mõõtmetes muutuda liiga suurteks, mis põhjustab väga suuri argumente softmax funktsioonis. See põhjustab "gradiente, mis hajuvad" probleemi — softmax muutub väga "rangeks", peaaegu üks element saab kaalu 1, ülejäänud peaaegu 0, mis halvendab õppimist. Skaalumine stabiliseerib gradientide väärtusi ja parandab mudeli konvergentsi.