Senior
İnferensdə prefiks keşi nədir?
sobes.tech Süni İntellekt
AI-dan cavab
Böyük dil modellərinin (LLM) çıxışında prefix caching, artıq işlənmiş tokenlar üçün ara hesablamaların saxlanması və növbəti tokenin yaradılmasında yenidən istifadə olunması texnikasıdır.
Mətn yaradarkən model hər tokeni ardıcıl işləyir və gizli vəziyyətləri hesablayır. Yeni token əlavə edilərkən, bütün ardıcıllıq üçün vəziyyətləri yenidən hesablamaq yerinə, prefix caching artıq yaradılmış hissə üçün nəticələri saxlamağa və onları birbaşa istifadə etməyə imkan verir.
Bu, xüsusən uzun ardıcıllıqların yaradılmasında hesablamanın yükünü və gecikməni əhəmiyyətli dərəcədə azaldır.
Təxminən belə görünür:
- t mərhələsində, 1..t tokenləri üçün vəziyyətlər hesablanır.
- t+1 mərhələsinə keçid zamanı, 1..t tokenləri üçün vəziyyətlər cache-dən götürülür və yalnız t+1 tokeni üçün vəziyyət hesablanır.
Bu səbəbdən, prefix caching LLM-lərdə səmərəli və sürətli çıxış üçün əsas texnikadır.