Davamlı toplama nədir və vLLM/TGI-də necə həyata keçirilir?
sobes.tech Süni İntellekt
AI-dan cavab
Davamlı toplu işləmə, maşın öyrənmə modeli üçün sorğuların işlənməsi texnikasıdır; burada daxil olan inference sorğuları davamlı və dinamik şəkildə toplu halına gətirilir, bu da hesablama resurslarından maksimum istifadə etməyə və gecikmələri azaltmağa imkan verir. Müəyyən bir vaxt və ya müəyyən sayda sorğu gözləmək əvəzinə, sistem davamlı olaraq daxil olan sorğulardan toplu yaradır və onları işləyir.
vLLM və TGI (Text Generation Inference) daxilində davamlı toplu işləmə, asinxron gözləmə və dinamik toplu formalaşdırma vasitəsilə həyata keçirilir. Məsələn, sorğu gəldikdə, o, növbəyə qoyulur və motor bir neçə sorğudan ibarət toplu yaratmağa çalışır, ilk sorğunu çox gecikdirmədən. Əgər yeni sorğular yoxdursa, toplu mövcud olanla işə salınır. Bu, GPU-dan səmərəli istifadə etməyə və hər sorğu üçün gecikməni minimuma endirməyə imkan verir.
Təxminən belə görünür:
- Sorğular növbəyə daxil olur.
- Sistem maksimum toplu ölçüsünə çatana və ya vaxt limiti keçənə qədər gözləyir.
- Toplu formalaşdırılır və modelə göndərilir.
- Nəticələr sorğulara geri paylanır.
Bu yanaşma, xüsusən də transformatorlar üçün faydalıdır, çünki toplu işləmə tək-tək sorğulara nisbətən çox daha səmərəlidir.