Sobes.tech
Middle — Senior

Pastāsti man par PagedAttention vLLM.

sobes.tech AI

Atbilde no AI

vLLM ietver PagedAttention, kas optimizāciju uzmanības mehānismā, lai apstrādātu garas secības transformatoros. Klasiskajā self-attention, aprēķinu sarežģītība un atmiņas patēriņš pieaug kvadrātiski ar ievades garumu, kas ierobežo mērogojamību.

PagedAttention sadala secību lapās un aprēķina uzmanību pa daļām, kas ļauj efektīvi izmantot atmiņu un paātrina aprēķinus. Tas ir īpaši noderīgi, ģenerējot tekstu ar garu kontekstu, kur ir nepieciešams saglabāt un apstrādāt lielu skaitu tokenu.

Tas darbojas aptuveni šādi:

  • Ievades secība tiek sadalīta fiksēta izmēra lapās.
  • Uzmanība tiek aprēķināta iekšā lapām un starp dažām lapām, lai saglabātu kontekstu.
  • Tiek izmantotas optimizācijas, lai minimizētu operācijas un atmiņas patēriņu.

Tādējādi, PagedAttention ļauj vLLM mērogot uz garām kontekstiem bez eksponenciālas izmaksu pieauguma.