Middle — Senior
Разкажи ми за PagedAttention в vLLM.
sobes.tech AI
Отговор от AI
PagedAttention в vLLM е оптимизация на механизма на внимание за обработка на дълги последователности в трансформърите. При класическото self-attention, изчислителната сложност и използването на памет се увеличават квадратично с дължината на входа, което ограничава мащабирането.
PagedAttention разделя последователността на страници и изчислява вниманието на части, което позволява ефективно използване на паметта и ускоряване на изчисленията. Това е особено полезно при генериране на текст с дълъг контекст, където е необходимо да се запазят и обработват голям брой токени.
Работи приблизително така:
- Входната последователност се разделя на страници с фиксиран размер.
- Вниманието се изчислява вътре в страницата и между някои страници, за да се запази контекстът.
- Използват се оптимизации за минимизиране на операциите и използването на памет.
По този начин, PagedAttention позволява на vLLM да се мащабира към дълги контексти без експоненциален растеж на разходите.