Sobes.tech
Middle — Senior

Erklären Sie die Formel der skalierten Dot-Product-Attention. Warum durch sqrt(d_k) teilen?

sobes.tech KI

Antwort von AI

Skalierte Punktprodukt-Aufmerksamkeit ist ein Mechanismus der Aufmerksamkeit, der die Gewichtungskoeffizienten für Elemente einer Sequenz basierend auf den Skalarprodukten von Anfragen (Q) und Schlüsseln (K) berechnet. Die Formel lautet:

[ \text{Attention}(Q, K, V) = \text{softmax}\left(\frac{QK^T}{\sqrt{d_k}}\right) V ]

Hier:

  • Q — Anfrage-Matrix,
  • K — Schlüssel-Matrix,
  • V — Wert-Matrix,
  • (d_k) — Dimension der Schlüsselvektoren.

Die Division durch (\sqrt{d_k}) ist notwendig, um das Ergebnis des Skalarprodukts zu skalieren. Ohne diesen Schritt können die Werte in hohen Dimensionen zu groß werden, was zu sehr großen Argumenten für die Softmax-Funktion führt. Dies verursacht das Problem der "verschwindenden Gradienten" — Softmax wird sehr "steif", ein Element erhält fast das Gewicht 1, die anderen fast 0, was das Training verschlechtert. Das Skalieren stabilisiert die Gradienten und verbessert die Konvergenz des Modells.