Sobes.tech
Middle — Senior

Разкажи ми за PagedAttention в vLLM.

sobes.tech AI

Отговор от AI

PagedAttention в vLLM е оптимизация на механизма на внимание за обработка на дълги последователности в трансформърите. При класическото self-attention, изчислителната сложност и използването на памет се увеличават квадратично с дължината на входа, което ограничава мащабирането.

PagedAttention разделя последователността на страници и изчислява вниманието на части, което позволява ефективно използване на паметта и ускоряване на изчисленията. Това е особено полезно при генериране на текст с дълъг контекст, където е необходимо да се запазят и обработват голям брой токени.

Работи приблизително така:

  • Входната последователност се разделя на страници с фиксиран размер.
  • Вниманието се изчислява вътре в страницата и между някои страници, за да се запази контекстът.
  • Използват се оптимизации за минимизиране на операциите и използването на памет.

По този начин, PagedAttention позволява на vLLM да се мащабира към дълги контексти без експоненциален растеж на разходите.