Sobes.tech
Middle — Senior

Paaiškinkite išskleistos taškinės dėmesio formulę. Kodėl dalijame iš sqrt(d_k)?

sobes.tech AI

Atsakymas iš AI

Масштабгардсан цэгийн үржвэр анхаарал нь анхаарлын механизм бөгөөд энэ нь Q (судалгаа) ба K (түлхүүр) гэсэн хоёр векторын скаляр үржвэр дээр үндэслэн дарааллын элементүүдэд жингийн коэффициентүүдийг тооцоолох механизм юм. Тэгвэл:

[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]

Энд:

  • Q — судалгааны матриц,
  • K — түлхүүрийн матриц,
  • V — утгын матриц,
  • (d_k) — түлхүүрийн векторын хэмжээ.

(\sqrt{d_k}) -ээр хуваах нь скаляр үржвэрийн үр дүнг масштаблах шаардлагатай. Энэ алхамгүйгээр, өндөр хэмжээтэй векторуудад утгууд хэт их болох бөгөөд softmax функцийн маш их аргументууд үүсдэг. Энэ нь "муутсан градиентүүд"-ийн асуудлыг үүсгэдэг — softmax маш "хатуу" болдог, бараг нэг элемент 1 жин авдаг, бусад нь бараг 0 болдог, энэ нь сургалтыг муутгадаг. Энэ масштаблах нь градиентуудыг тогтворжуулж, загварын нийцлийг сайжруулдаг.