Middle — Senior
Porozprávaj mi o PagedAttention v vLLM.
sobes.tech AI
Odpoveď od AI
PagedAttention v vLLM je optimalizácia mechanizmu pozornosti na spracovanie dlhých sekvencií v transformeroch. Pri klasickej self-attention rastie výpočtová zložitosť a spotreba pamäte kvadraticky s dĺžkou vstupu, čo obmedzuje škálovateľnosť.
PagedAttention delí sekvenciu na stránky a počíta pozornosť po častiach, čo umožňuje efektívne využitie pamäte a zrýchlenie výpočtov. To je obzvlášť užitočné pri generovaní textu s dlhým kontextom, kde je potrebné uchovávať a spracovávať veľké množstvo tokenov.
Približne to funguje takto:
- Vstupná sekvencia je rozdelená na stránky pevnej veľkosti.
- Pozornosť sa počíta vnútri stránky a medzi niektorými stránkami, aby sa zachoval kontext.
- Používajú sa optimalizácie na minimalizáciu operácií a využitia pamäte.
Týmto spôsobom PagedAttention umožňuje vLLM škálovať na dlhé kontexty bez exponenciálneho rastu nákladov.