Sobes.tech
Middle

Quais são as três matrizes usadas na atenção multi-cabeça?

sobes.tech IA

Resposta da IA

Na atenção multi-cabeça, são utilizadas três matrizes principais, que são formadas a partir dos dados de entrada:

  1. Query (Q) — matriz de consultas, que determina a quais elementos da entrada deve-se prestar atenção.
  2. Key (K) — matriz de chaves, usada para fazer correspondência com as consultas e determinar a relevância.
  3. Value (V) — matriz de valores, que contém a informação que será agregada no resultado da atenção.

O processo de atenção calcula os pesos de atenção como o produto escalar entre Q e K, normaliza-os e aplica-os a V para obter uma soma ponderada dos valores. No attention multi-cabeça, esse processo é repetido várias vezes em paralelo com diferentes projeções de Q, K e V, permitindo que o modelo capture diferentes aspectos da informação.