Sobes.tech
Middle — Senior

Mesélj a PagedAttention-ről a vLLM-ben.

sobes.tech MI

Válasz az MI-től

A PagedAttention a vLLM-ben egy optimalizációja a figyelem (attention) mechanizmusnak, amely hosszú szekvenciák feldolgozására szolgál a transzformátorokban. A klasszikus self-attention esetén a számítási komplexitás és a memóriaigény négyzetesen nő a bemenet hosszával, ami korlátozza a skálázhatóságot.

A PagedAttention a szekvenciát oldalanként (oldalakra) osztja, és részletekben számítja ki a figyelmet, így hatékonyabban lehet használni a memóriát és gyorsítani a számításokat. Ez különösen hasznos hosszú kontextusú szöveg generálásakor, ahol sok token tárolása és feldolgozása szükséges.

Kb. így működik:

  • A bemeneti szekvencia fix méretű oldalokra van osztva.
  • A figyelem az oldalakon belül és néhány oldal között kerül kiszámításra, hogy megőrizze a kontextust.
  • Optimalizációkat alkalmaznak az műveletek és a memóriahasználat minimalizálására.

Így a PagedAttention lehetővé teszi a vLLM számára, hogy hosszú kontextusokra skálázzon anélkül, hogy exponenciális költségnövekedés lenne.