Middle — Senior
vLLM-də PagedAttention haqqında danış.
sobes.tech Süni İntellekt
AI-dan cavab
vLLM-də PagedAttention, transformatorlarda uzun ardıcıllıqları emal etmək üçün diqqət mexanizminin optimizasiyasıdır. Klassik öz-özünə diqqətdə, hesablamanın mürəkkəbliyi və yaddaş istifadəsi girişin uzunluğu ilə kvadrat şəkildə artır, bu da miqyaslandırmanı məhdudlaşdırır.
PagedAttention ardıcıllığı səhifələrə bölür və diqqəti hissələrə hesablayır, bu da yaddaşın səmərəli istifadəsinə və hesablamaların sürətləndirilməsinə imkan verir. Bu, uzun kontekstli mətnin yaradılmasında, çox sayda tokenin saxlanması və işlənməsi lazım olduqda xüsusilə faydalıdır.
Əsasən belə işləyir:
- Giriş ardıcıllığı sabit ölçülü səhifələrə bölünür.
- Diqqət hər səhifə daxilində və bəzi səhifələr arasında hesablanır, beləliklə kontekst qorunur.
- Əməliyyatları və yaddaş istifadəsini minimuma endirmək üçün optimizasiyalar istifadə olunur.
Beləliklə, PagedAttention vLLM-in uzun kontekstlərə miqyaslanmasına imkan verir, bu da xərclərin eksponensial artımını qarşısını alır.