Sobes.tech
Middle — Senior

Porozprávaj mi o PagedAttention v vLLM.

sobes.tech AI

Odpoveď od AI

PagedAttention v vLLM je optimalizácia mechanizmu pozornosti na spracovanie dlhých sekvencií v transformeroch. Pri klasickej self-attention rastie výpočtová zložitosť a spotreba pamäte kvadraticky s dĺžkou vstupu, čo obmedzuje škálovateľnosť.

PagedAttention delí sekvenciu na stránky a počíta pozornosť po častiach, čo umožňuje efektívne využitie pamäte a zrýchlenie výpočtov. To je obzvlášť užitočné pri generovaní textu s dlhým kontextom, kde je potrebné uchovávať a spracovávať veľké množstvo tokenov.

Približne to funguje takto:

  • Vstupná sekvencia je rozdelená na stránky pevnej veľkosti.
  • Pozornosť sa počíta vnútri stránky a medzi niektorými stránkami, aby sa zachoval kontext.
  • Používajú sa optimalizácie na minimalizáciu operácií a využitia pamäte.

Týmto spôsobom PagedAttention umožňuje vLLM škálovať na dlhé kontexty bez exponenciálneho rastu nákladov.