Sobes.tech
Middle — Senior

vLLM'deki PagedAttention hakkında bana bilgi ver.

sobes.tech yapay zeka

AI'dan gelen yanıt

vLLM'deki PagedAttention, dönüştürücülerde uzun dizileri işlemek için dikkat mekanizmasının bir optimizasyonudur. Klasik self-attention'da, hesaplama karmaşıklığı ve bellek kullanımı giriş uzunluğu ile karesel olarak artar, bu da ölçeklenebilirliği sınırlar.

PagedAttention, diziyi sayfalara böler ve dikkat hesaplamasını parça parça yapar, bu da belleğin verimli kullanılmasını ve hesaplamaların hızlandırılmasını sağlar. Bu, uzun bağlamlı metin üretiminde, çok sayıda token'ı saklamanın ve işlemenin gerektiği durumlarda özellikle faydalıdır.

Yaklaşık olarak şöyle çalışır:

  • Giriş dizisi, sabit boyutlu sayfalara bölünür.
  • Dikkat, sayfa içinde ve bazı sayfalar arasında hesaplanır, böylece bağlam korunur.
  • İşlemleri ve bellek kullanımını en aza indirmek için optimizasyonlar kullanılır.

Bu şekilde, PagedAttention, vLLM'nin uzun bağlamlara ölçeklenmesini sağlar, maliyetlerde üssel bir artış olmadan.