Sobes.tech
Senior

İnferansda prefix önbelleği nedir?

sobes.tech yapay zeka

AI'dan gelen yanıt

Büyük dil modellerinin (LLM) çıkarımında prefix önbellekleme, zaten işlenmiş tokenlar için ara hesaplamaların saklandığı ve bir sonraki token üretilirken tekrar kullanıldığı bir optimizasyon tekniğidir.

Metin üretirken, model her tokeni sıralı olarak işler ve gizli durumları hesaplar. Yeni bir token eklenirken tüm dizinin durumlarını yeniden hesaplamak yerine, prefix önbellekleme, önceden üretilmiş kısmın (önceden oluşturulmuş bölüm) sonuçlarını saklamaya ve doğrudan kullanmaya olanak tanır.

Bu, özellikle uzun dizilerin üretilmesinde hesaplama yükünü ve gecikmeleri azaltarak çıkarımı önemli ölçüde hızlandırır.

Yaklaşık olarak şu şekilde görünür:

  • t adımında, 1..t tokenleri için durumlar hesaplanır.
  • t+1 adımına geçerken, 1..t tokenleri için durumlar önbellekten alınır ve sadece t+1 tokeni için durum hesaplanır.

Bu nedenle, prefix önbellekleme, LLM'lerde verimli ve hızlı çıktı için anahtar bir tekniktir.