Cache-и пешфарз дар инференс чист?
sobes.tech AI
Ҷавоб аз AI
Кеширанти префиксҳо дар inference-и моделҳои калонтарини забон (LLM) як техникаи оптимизатсия мебошад, ки дар он ҳисобҳои миёна барои токенҳои аллакай коркардшуда нигоҳ дошта мешаванд ва дар вақти генер кардани токени нав такрор истифода мешаванд.
Дар вақти генер кардани матн, модел ҳар токенро пайдарпай коркард мекунад ва ҳолатҳои пинҳонаро ҳисоб мекунад. Ба ҷои ҳисоб кардани ҳама ҳолатҳо барои тамоми пайдархас, кеширатсияи префикс имкон медиҳад, ки натиҷаҳо барои префикс (қисми аллакай тавлидшуда) нигоҳ дошта шаванд ва мустақиман истифода шаванд.
Ин ба таври назаррас inference-ро суръат мебахшад, боррои ҳисоббарорӣ ва таъхирҳоро кам мекунад, махсусан дар вақти генер кардани пайдарпайи дароз.
Тақрибан чунин менамояд:
- Дар қадами t, ҳолатҳо барои токенҳои 1..t ҳисоб карда мешаванд.
- Дар гузаштан ба қадами t+1, ҳолатҳо барои токенҳои 1..t аз кеш гирифта мешаванд ва танҳо ҳолати барои токени t+1 ҳисоб карда мешавад.
Аз ин рӯ, кеширатсияи префиксҳо як техникаи асосӣ барои баромади муассир ва суръатбахш дар LLM мебошад.