Middle
¿Qué tres matrices se utilizan en la atención multi-cabeza?
sobes.tech AI
Respuesta de la IA
En la atención multi-cabeza se utilizan tres matrices principales, que se forman a partir de los datos de entrada:
- Consulta (Q) — matriz de consultas, que determina a qué elementos de la entrada se debe prestar atención.
- Clave (K) — matriz de claves, que se usa para emparejar con las consultas y determinar la relevancia.
- Valor (V) — matriz de valores, que contiene la información que será agregada en el resultado de la atención.
El proceso de atención calcula los pesos de atención como el producto escalar entre Q y K, los normaliza y los aplica a V para obtener una suma ponderada de los valores. En la atención multi-cabeza, este proceso se repite varias veces en paralelo con diferentes proyecciones de Q, K y V, lo que permite al modelo capturar diferentes aspectos de la información.