Continuous batching nima va uni vLLM/TGI da qanday amalga oshiriladi?
sobes.tech AI
AIdan javob
Davomli batching — bu mashina o‘rganish modeli uchun so‘rovlarni qayta ishlash texnikasidir, bunda kiruvchi inference so‘rovlar doimiy va dinamik tarzda partiyalarga yig‘iladi, bu esa hisoblash resurslarini maksimal darajada ishlatish va kechikishni kamaytirish uchun mo‘ljallangan. Muayyan vaqt yoki muayyan so‘rovlar sonini kutish o‘rniga, tizim doimiy ravishda kelayotgan so‘rovlar asosida partiyalar hosil qiladi va ularni ishlatadi.
vLLM va TGI (Text Generation Inference)da, doimiy batching asinxron kutish va dinamik partiya tuzish orqali amalga oshiriladi. Masalan, so‘rov kelganda, u navbatga qo‘yiladi, va motor bir nechta so‘rovdan iborat partiyani tuishga harakat qiladi, birinchi so‘rovni juda kechiktirmasdan. Agar yangi so‘rovlar bo‘lmasa, partiya mavjud bo‘shash bilan ishga tushiriladi. Bu bir vaqtning o‘zida bir nechta so‘rovlarni samarali GPUdan foydalanib, kechikishni minimallashtirish imkonini beradi.
Taxminan, bu quyidagicha ishlaydi:
- So‘rovlar navbatga keladi.
- Tizim maksimal partiya o‘lchamiga yetishni yoki timeoutning o‘tishini kutadi.
- Partiya tuziladi va modelga yuboriladi.
- Natijalar so‘rovlar bo‘yicha taqsimlanadi.
Bu yondashuv ayniqsa transformerlar uchun foydalidir, chunki partiyalash ishlov berish yakka so‘rovlar bilan solishtirganda ancha samaraliroq.