Sobes.tech
Middle — Senior

Обяснете формулата за мащабираното внимание чрез скаларно произведение. Защо делим на sqrt(d_k)?

sobes.tech AI

Отговор от AI

Мащабираната точка-продукт внимание е механизъм за внимание, който изчислява коефициентите за тегло за елементите на последователността въз основа на скаларните произведения на заявките (Q) и ключовете (K). Формулата изглежда така:

[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]

Тук:

  • Q — матрица на заявките,
  • K — матрица на ключовете,
  • V — матрица на стойностите,
  • (d_k) — размерността на векторите на ключовете.

Делението на (\sqrt{d_k}) е необходимо за мащабиране на резултата от скаларното произведение. Без тази стъпка стойностите могат да станат твърде големи при големи размерности, което води до много големи аргументи за функцията softmax. Това причинява проблема с "затихващите градиенти" — softmax става много "строг", почти един елемент получава тегло 1, а останалите — почти 0, което влошава обучението. Мащабирането стабилизира градиентите и подобрява сходимостта на модела.