Senior
Co je to prefix caching při inferenci?
sobes.tech AI
Odpověď od AI
Prefix caching v inferenci velkých jazykových modelů (LLM) je technika optimalizace, při níž se mezilehlé výpočty pro již zpracované tokeny ukládají a při generování dalšího tokenu se znovu používají.
Při generování textu model sekvenčně zpracovává každý token a počítá skryté stavy. Místo toho, aby znovu počítal všechny stavy pro celou sekvenci při přidání nového tokenu, umožňuje prefix caching uložit výsledky pro prefix (již vygenerovanou část) a přímo je použít.
To výrazně urychluje inference, snižuje výpočetní zátěž a latenci, zejména při generování dlouhých sekvencí.
Přibližně to vypadá takto:
- V kroku t se počítají stavy pro tokeny 1..t.
- Při přechodu na krok t+1 se stavy pro tokeny 1..t načtou z cache a počítá se pouze stav pro token t+1.
Tímto způsobem je prefix caching klíčovou technikou pro efektivní a rychlý výstup v LLM.