Middle
Quais são as três matrizes usadas na atenção multi-cabeça?
sobes.tech IA
Resposta da IA
Na atenção multi-cabeça, são utilizadas três matrizes principais, que são formadas a partir dos dados de entrada:
- Query (Q) — matriz de consultas, que determina a quais elementos da entrada deve-se prestar atenção.
- Key (K) — matriz de chaves, usada para fazer correspondência com as consultas e determinar a relevância.
- Value (V) — matriz de valores, que contém a informação que será agregada no resultado da atenção.
O processo de atenção calcula os pesos de atenção como o produto escalar entre Q e K, normaliza-os e aplica-os a V para obter uma soma ponderada dos valores. No attention multi-cabeça, esse processo é repetido várias vezes em paralelo com diferentes projeções de Q, K e V, permitindo que o modelo capture diferentes aspectos da informação.