Sobes.tech
Middle — Senior

Mi az a folyamatos batching, és hogyan valósítják meg a vLLM/TGI-ben?

sobes.tech MI

Válasz az MI-től

A folyamatos kötegelt feldolgozás egy olyan technika, amely során a gépi tanulási modellhez érkező kéréseket folyamatosan és dinamikusan gyűjtik össze kötegekbe, hogy maximálisan kihasználják a számítási erőforrásokat és csökkentsék a késleltetést. Ahelyett, hogy egy fix időt vagy egy fix kérés számát várnánk, a rendszer folyamatosan alakít ki kötegeket a beérkező kérésekből, és azokat feldolgozza.

A vLLM és TGI (Text Generation Inference) esetében a folyamatos kötegelt feldolgozást aszinkron várakozás és dinamikus kötegalkotás révén valósítják meg. Például, amikor egy kérés érkezik, az sorba kerül, és a motor megpróbál több kérésből köteget alkotni, anélkül, hogy túl sokáig késleltetné az első kérés feldolgozását. Ha nincsenek új kérdések, a köteg elindul a rendelkezésre álló kérdésekkel. Ez lehetővé teszi több kérés egyidejű feldolgozását, hatékony GPU-használattal és minden kérés késleltetésének minimalizálásával.

Kb. így néz ki:

  • A kérdések sorba kerülnek.
  • A rendszer vár, amíg el nem éri a maximális köteg méretet vagy a várakozási idő lejár.
  • Készül egy köteg, és elküldik a modellnek.
  • Az eredmények visszaosztásra kerülnek a kérdésekhez.

Ez a megközelítés különösen hasznos a transzformátorok esetében, ahol a kötegelt feldolgozás sokkal hatékonyabb, mint az egyedi kérdések esetében.