Sobes.tech
Middle — Senior

Pověz mi o PagedAttention v vLLM.

sobes.tech AI

Odpověď od AI

PagedAttention v vLLM je optimalizace mechanismu pozornosti pro zpracování dlouhých sekvencí v transformátorech. U klasické self-attention roste výpočetní složitost a paměťová náročnost kvadraticky s délkou vstupu, což omezuje škálovatelnost.

PagedAttention dělí sekvenci na stránky a počítá pozornost po částech, což umožňuje efektivní využití paměti a urychlení výpočtů. To je obzvlášť užitečné při generování textu s dlouhým kontextem, kde je třeba uchovávat a zpracovávat velké množství tokenů.

Přibližně to funguje takto:

  • Vstupní sekvence je rozdělena na stránky pevné velikosti.
  • Pozornost se počítá uvnitř stránky a mezi některými stránkami, aby se zachoval kontext.
  • Používají se optimalizace ke snížení operací a využití paměti.

Tímto způsobem PagedAttention umožňuje vLLM škálovat na dlouhé kontexty bez exponenciálního růstu nákladů.