Sobes.tech
Middle — Senior

Cuéntame sobre PagedAttention en vLLM.

sobes.tech AI

Respuesta de la IA

PagedAttention en vLLM es una optimización del mecanismo de atención para procesar secuencias largas en transformadores. En la atención propia clásica, la complejidad computacional y el consumo de memoria crecen cuadráticamente con la longitud de la entrada, lo que limita la escalabilidad.

PagedAttention divide la secuencia en páginas y calcula la atención por partes, lo que permite usar la memoria de manera eficiente y acelerar los cálculos. Esto es especialmente útil en la generación de texto con un contexto largo, donde se necesita mantener y procesar una gran cantidad de tokens.

Funciona aproximadamente así:

  • La secuencia de entrada se divide en páginas de tamaño fijo.
  • La atención se calcula dentro de cada página y entre algunas páginas para mantener el contexto.
  • Se utilizan optimizaciones para minimizar operaciones y uso de memoria.

De esta forma, PagedAttention permite que vLLM escale a contextos largos sin un crecimiento exponencial en los costos.