Sobes.tech
Middle

¿Qué tres matrices se utilizan en la atención multi-cabeza?

sobes.tech AI

Respuesta de la IA

En la atención multi-cabeza se utilizan tres matrices principales, que se forman a partir de los datos de entrada:

  1. Consulta (Q) — matriz de consultas, que determina a qué elementos de la entrada se debe prestar atención.
  2. Clave (K) — matriz de claves, que se usa para emparejar con las consultas y determinar la relevancia.
  3. Valor (V) — matriz de valores, que contiene la información que será agregada en el resultado de la atención.

El proceso de atención calcula los pesos de atención como el producto escalar entre Q y K, los normaliza y los aplica a V para obtener una suma ponderada de los valores. En la atención multi-cabeza, este proceso se repite varias veces en paralelo con diferentes proyecciones de Q, K y V, lo que permite al modelo capturar diferentes aspectos de la información.