Cos'è l'attenzione multi-query e dove viene utilizzata?
sobes.tech AI
Risposta dell'AI
L'attenzione multi-query è una modifica del meccanismo di attenzione nei trasformatori, in cui più chiavi (keys) e valori (values) vengono combinati in un insieme comune, e per ogni query (query) viene utilizzato un insieme separato di query. Questo permette di ridurre significativamente l'uso di memoria e i costi computazionali, specialmente quando si lavora con sequenze lunghe, mantenendo la qualità del modello.
L'applicazione principale dell'attenzione multi-query è nei grandi modelli di linguaggio e trasformatori, dove efficienza e scalabilità sono importanti, ad esempio in GPT-4 e altre architetture moderne. Questo approccio aiuta ad accelerare l'inferenza e a ridurre i requisiti di risorse senza una perdita sostanziale di precisione.
Esempio: invece di avere chiavi e valori separati per ogni testa di attenzione (multi-head attention), tutte le teste usano un insieme comune di chiavi e valori, e le query rimangono individuali.