Middle — Senior
Ispričaj mi o PagedAttention u vLLM.
sobes.tech АИ
Одговор од АИ
PagedAttention u vLLM je optimizacija mehanizma pažnje za obradu dugih sekvenci u transformatorima. U klasičnoj self-attention, složenost izračuna i potrošnja memorije rastu kvadratno sa dužinom ulaza, što ograničava skalabilnost.
PagedAttention deli sekvencu na stranice i računa pažnju delimično, što omogućava efikasno korišćenje memorije i ubrzava izračunavanja. Ovo je posebno korisno pri generisanju teksta sa dugim kontekstom, gde je potrebno sačuvati i obraditi veliki broj tokena.
Otprilike funkcioniše ovako:
- Ulazna sekvenca je podeljena na stranice fiksne veličine.
- Pažnja se računa unutar stranice i između nekih stranica, kako bi se sačuvao kontekst.
- Koriste se optimizacije za minimizaciju operacija i potrošnje memorije.
Na ovaj način, PagedAttention omogućava vLLM da se skalira na duge kontekste bez eksponencijalnog rasta troškova.