Middle — Senior
Pověz mi o PagedAttention v vLLM.
sobes.tech AI
Odpověď od AI
PagedAttention v vLLM je optimalizace mechanismu pozornosti pro zpracování dlouhých sekvencí v transformátorech. U klasické self-attention roste výpočetní složitost a paměťová náročnost kvadraticky s délkou vstupu, což omezuje škálovatelnost.
PagedAttention dělí sekvenci na stránky a počítá pozornost po částech, což umožňuje efektivní využití paměti a urychlení výpočtů. To je obzvlášť užitečné při generování textu s dlouhým kontextem, kde je třeba uchovávat a zpracovávat velké množství tokenů.
Přibližně to funguje takto:
- Vstupní sekvence je rozdělena na stránky pevné velikosti.
- Pozornost se počítá uvnitř stránky a mezi některými stránkami, aby se zachoval kontext.
- Používají se optimalizace ke snížení operací a využití paměti.
Tímto způsobem PagedAttention umožňuje vLLM škálovat na dlouhé kontexty bez exponenciálního růstu nákladů.