Paaiškinkite išskleistos taškinės dėmesio formulę. Kodėl dalijame iš sqrt(d_k)?
sobes.tech AI
Atsakymas iš AI
Масштабгардсан цэгийн үржвэр анхаарал нь анхаарлын механизм бөгөөд энэ нь Q (судалгаа) ба K (түлхүүр) гэсэн хоёр векторын скаляр үржвэр дээр үндэслэн дарааллын элементүүдэд жингийн коэффициентүүдийг тооцоолох механизм юм. Тэгвэл:
[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]
Энд:
- Q — судалгааны матриц,
- K — түлхүүрийн матриц,
- V — утгын матриц,
- (d_k) — түлхүүрийн векторын хэмжээ.
(\sqrt{d_k}) -ээр хуваах нь скаляр үржвэрийн үр дүнг масштаблах шаардлагатай. Энэ алхамгүйгээр, өндөр хэмжээтэй векторуудад утгууд хэт их болох бөгөөд softmax функцийн маш их аргументууд үүсдэг. Энэ нь "муутсан градиентүүд"-ийн асуудлыг үүсгэдэг — softmax маш "хатуу" болдог, бараг нэг элемент 1 жин авдаг, бусад нь бараг 0 болдог, энэ нь сургалтыг муутгадаг. Энэ масштаблах нь градиентуудыг тогтворжуулж, загварын нийцлийг сайжруулдаг.