Sobes.tech
Middle — Senior

Cos'è l'attenzione multi-query e dove viene utilizzata?

sobes.tech AI

Risposta dell'AI

L'attenzione multi-query è una modifica del meccanismo di attenzione nei trasformatori, in cui più chiavi (keys) e valori (values) vengono combinati in un insieme comune, e per ogni query (query) viene utilizzato un insieme separato di query. Questo permette di ridurre significativamente l'uso di memoria e i costi computazionali, specialmente quando si lavora con sequenze lunghe, mantenendo la qualità del modello.

L'applicazione principale dell'attenzione multi-query è nei grandi modelli di linguaggio e trasformatori, dove efficienza e scalabilità sono importanti, ad esempio in GPT-4 e altre architetture moderne. Questo approccio aiuta ad accelerare l'inferenza e a ridurre i requisiti di risorse senza una perdita sostanziale di precisione.

Esempio: invece di avere chiavi e valori separati per ogni testa di attenzione (multi-head attention), tutte le teste usano un insieme comune di chiavi e valori, e le query rimangono individuali.