Какво е непрекъснато групиране и как се реализира в vLLM/TGI?
sobes.tech AI
Отговор от AI
Непрекъснатото групиране е техника за обработка на заявки към модел за машинно обучение, при която входящите заявки за inference се събират непрекъснато и динамично в групи, за да се използват максимално изчислителните ресурси и да се намали закъснението. Вместо да се чака фиксирано време или фиксирано количество заявки, системата постоянно формира групи от пристигащите заявки и ги обработва.
В vLLM и TGI (Text Generation Inference) непрекъснатото групиране се реализира чрез асинхронно очакване и динамично формиране на групи. Например, когато пристигне заявка, тя се поставя в опашка, и моторът се опитва да формира група от няколко заявки, без да забавя прекалено първата. Ако няма нови заявки, групата се стартира с наличното. Това позволява едновременно обработване на няколко заявки, ефективно използване на GPU и минимизиране на закъсненията за всяка заявка.
Приблизително това изглежда така:
- Заявките пристигат в опашката.
- Системата чака, докато достигне максималния размер на групата или изтече тайм-аутът.
- Сформира се група и се изпраща към модела.
- Резултатите се разпределят обратно към заявките.
Този подход е особено полезен за трансформатори, където обработката на групи е значително по-ефективна в сравнение с единичните заявки.