Sobes.tech
Senior

Co je to prefix caching při inferenci?

sobes.tech AI

Odpověď od AI

Prefix caching v inferenci velkých jazykových modelů (LLM) je technika optimalizace, při níž se mezilehlé výpočty pro již zpracované tokeny ukládají a při generování dalšího tokenu se znovu používají.

Při generování textu model sekvenčně zpracovává každý token a počítá skryté stavy. Místo toho, aby znovu počítal všechny stavy pro celou sekvenci při přidání nového tokenu, umožňuje prefix caching uložit výsledky pro prefix (již vygenerovanou část) a přímo je použít.

To výrazně urychluje inference, snižuje výpočetní zátěž a latenci, zejména při generování dlouhých sekvencí.

Přibližně to vypadá takto:

  • V kroku t se počítají stavy pro tokeny 1..t.
  • Při přechodu na krok t+1 se stavy pro tokeny 1..t načtou z cache a počítá se pouze stav pro token t+1.

Tímto způsobem je prefix caching klíčovou technikou pro efektivní a rychlý výstup v LLM.