Sobes.tech
Middle — Senior

Какво е непрекъснато групиране и как се реализира в vLLM/TGI?

sobes.tech AI

Отговор от AI

Непрекъснатото групиране е техника за обработка на заявки към модел за машинно обучение, при която входящите заявки за inference се събират непрекъснато и динамично в групи, за да се използват максимално изчислителните ресурси и да се намали закъснението. Вместо да се чака фиксирано време или фиксирано количество заявки, системата постоянно формира групи от пристигащите заявки и ги обработва.

В vLLM и TGI (Text Generation Inference) непрекъснатото групиране се реализира чрез асинхронно очакване и динамично формиране на групи. Например, когато пристигне заявка, тя се поставя в опашка, и моторът се опитва да формира група от няколко заявки, без да забавя прекалено първата. Ако няма нови заявки, групата се стартира с наличното. Това позволява едновременно обработване на няколко заявки, ефективно използване на GPU и минимизиране на закъсненията за всяка заявка.

Приблизително това изглежда така:

  • Заявките пристигат в опашката.
  • Системата чака, докато достигне максималния размер на групата или изтече тайм-аутът.
  • Сформира се група и се изпраща към модела.
  • Резултатите се разпределят обратно към заявките.

Този подход е особено полезен за трансформатори, където обработката на групи е значително по-ефективна в сравнение с единичните заявки.