Sobes.tech
Middle — Senior

Ispričaj mi o PagedAttention u vLLM.

sobes.tech АИ

Одговор од АИ

PagedAttention u vLLM je optimizacija mehanizma pažnje za obradu dugih sekvenci u transformatorima. U klasičnoj self-attention, složenost izračuna i potrošnja memorije rastu kvadratno sa dužinom ulaza, što ograničava skalabilnost.

PagedAttention deli sekvencu na stranice i računa pažnju delimično, što omogućava efikasno korišćenje memorije i ubrzava izračunavanja. Ovo je posebno korisno pri generisanju teksta sa dugim kontekstom, gde je potrebno sačuvati i obraditi veliki broj tokena.

Otprilike funkcioniše ovako:

  • Ulazna sekvenca je podeljena na stranice fiksne veličine.
  • Pažnja se računa unutar stranice i između nekih stranica, kako bi se sačuvao kontekst.
  • Koriste se optimizacije za minimizaciju operacija i potrošnje memorije.

Na ovaj način, PagedAttention omogućava vLLM da se skalira na duge kontekste bez eksponencijalnog rasta troškova.