Sobes.tech
Middle — Senior

Objasnite formulu skalirane pažnje tačke-umnožavanja. Zašto deliti sa sqrt(d_k)?

sobes.tech АИ

Одговор од АИ

Маскираниот точка-продукт вниманието е механизам за внимание кој пресметува коефициенти за тежина за елементите на секвенцата врз основа на скаларните производи на барањата (Q) и клучевите (K). Формулата изгледа вака:

[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]

Тука:

  • Q — матрица на барања,
  • K — матрица на клучеви,
  • V — матрица на вредности,
  • (d_k) — големината на векторите на клучевите.

Делбата со (\sqrt{d_k}) е потребна за скалирање на резултатот од скаларниот производ. Без овој чекор, вредностите можат да станат премногу големи во големи димензии, што доведува до многу големи аргументи за функцијата softmax. Ова предизвикува проблемот со "затихнувачките градиенти" — softmax станува многу "строг", речиси елемент добива тежина 1, а другите — речиси 0, што го влошува тренирањето. Скалирањето ја стабилизира градиентите и ја подобрува конвергенцијата на моделот.