Sobes.tech
Middle — Senior

Opowiedz o PagedAttention w vLLM.

sobes.tech AI

Odpowiedź od AI

PagedAttention w vLLM to optymalizacja mechanizmu uwagi (attention) do obsługi długich sekwencji w transformatorach. W klasycznej self-attention złożoność obliczeniowa i zużycie pamięci rosną kwadratowo wraz z długością wejścia, co ogranicza skalowalność.

PagedAttention dzieli sekwencję na strony i oblicza uwagę partiami, co pozwala na efektywne wykorzystanie pamięci i przyspiesza obliczenia. Jest to szczególnie przydatne przy generowaniu tekstu z długim kontekstem, gdzie trzeba przechowywać i przetwarzać dużą liczbę tokenów.

Działa to mniej więcej tak:

  • Sekwencja wejściowa jest dzielona na strony o stałym rozmiarze.
  • Uwaga jest obliczana wewnątrz strony i między niektórymi stronami, aby zachować kontekst.
  • Używane są optymalizacje minimalizujące operacje i zużycie pamięci.

W ten sposób PagedAttention pozwala vLLM skalować się na długie konteksty bez wykładniczego wzrostu kosztów.