Sobes.tech
Middle — Senior

Papaskink apie PagedAttention vLLM.

sobes.tech AI

Atsakymas iš AI

vLLM'de PagedAttention, transformatorlarda uzun dizileri işlemek üçün diqqət mexanizminin optimizasiyasıdır. Klassik self-attention-də, hesablamanın mürəkkəbliyi və yaddaş istifadəsi giriş uzunluğu ilə kvadrat şəkildə artır, bu da miqyaslandırmanı məhdudlaşdırır.

PagedAttention, ardıcıllığı səhifələrə bölür və diqqəti hissələrə hesablayır, bu da yaddaşın səmərəli istifadəsinə və hesablamaların sürətləndirilməsinə imkan verir. Bu, uzun kontekstli mətnin yaradılmasında, çox sayda tokenin saxlanması və işlənməsi lazım olduqda xüsusilə faydalıdır.

Əsasən belə işləyir:

  • Giriş ardıcıllığı sabit ölçülü səhifələrə bölünür.
  • Diqqət hər səhifə daxilində və bəzi səhifələr arasında hesablanır, beləliklə kontekst qorunur.
  • Optimalizasiya istifadə olunur əməliyyatların və yaddaş istifadəsinin minimallaşdırılması üçün.

Bu yolla, PagedAttention, vLLM-ə uzun kontekstlərə miqyaslanmağa imkan verir, bu da xərclərin eksponentual artımını qarşısını alır.