Sobes.tech
Middle — Senior

Fale sobre PagedAttention no vLLM.

sobes.tech IA

Resposta da IA

O PagedAttention no vLLM é uma otimização do mecanismo de atenção para processar sequências longas em transformadores. Na atenção própria clássica, a complexidade computacional e o consumo de memória crescem quadraticamente com o comprimento da entrada, o que limita a escalabilidade.

O PagedAttention divide a sequência em páginas e calcula a atenção por partes, permitindo usar a memória de forma eficiente e acelerar os cálculos. Isso é especialmente útil na geração de texto com um contexto longo, onde é necessário manter e processar uma grande quantidade de tokens.

Funciona aproximadamente assim:

  • A sequência de entrada é dividida em páginas de tamanho fixo.
  • A atenção é calculada dentro de cada página e entre algumas páginas para manter o contexto.
  • São usadas otimizações para minimizar operações e uso de memória.

Assim, o PagedAttention permite que o vLLM escale para contextos longos sem crescimento exponencial dos custos.