Sobes.tech
Middle — Senior

Spune-mi despre PagedAttention în vLLM.

sobes.tech AI

Răspuns de la AI

PagedAttention în vLLM reprezintă o optimizare a mecanismului de atenție pentru procesarea secvențelor lungi în transformatoare. În atenția proprie clasică, complexitatea computațională și consumul de memorie cresc quadratic odată cu lungimea intrării, ceea ce limitează scalabilitatea.

PagedAttention împarte secvența în pagini și calculează atenția pe părți, ceea ce permite utilizarea eficientă a memoriei și accelerarea calculelor. Acest lucru este deosebit de util în generarea de text cu un context lung, unde este necesar să se păstreze și să se proceseze un număr mare de tokeni.

Funcționează aproximativ astfel:

  • Secvența de intrare este împărțită în pagini de dimensiune fixă.
  • Atenția este calculată în interiorul fiecărei pagini și între unele pagini pentru a păstra contextul.
  • Se folosesc optimizări pentru a minimiza operațiile și utilizarea memoriei.

Astfel, PagedAttention permite vLLM să se scaleze pe contexte lungi fără o creștere exponențială a costurilor.