Sobes.tech
Middle — Senior

Mis on pidev batching ja kuidas seda rakendatakse vLLM/TGI-s?

sobes.tech AI

Vastus AI-lt

Pidev partii koostamine on tehnika, mis võimaldab töödelda sisendküsimusi masinõppemudeli jaoks, kus sisenevad inference-päringud kogutakse pidevalt ja dünaamiliselt partii, et maksimeerida arvutusressurite kasutust ja vähendada viivitust. Selle asemel, et oodata fikseeritud aega või fikseeritud arvu päringuid, moodustab süsteem pidevalt partii sisenevatest päringutest ja töötab neid.

vLLM ja TGI (Text Generation Inference) puhul realiseeritakse pidev partii koostamine asünkroonse ootamise ja dünaamilise partii moodustamise kaudu. Näiteks, kui päring saabub, pannakse see järjekorda, ja mootor püüab moodustada mitme päringu partii, mitte liiga kaua oodates esimese päringu töötlemist. Kui uusi päringuid ei ole, käivitatakse partii olemasolevaga. See võimaldab samaaegselt töödelda mitut päringut, tõhusalt kasutades GPU-d ja minimeerides iga päringu viivitust.

Umbes see näeb välja:

  • Päringud jõuavad järjekorda.
  • Süsteem ootab kuni saavutab maksimaalse partii suuruse või aeg lõpeb.
  • Moodustatakse partii ja saadetakse mudelile.
  • Tulemused jagatakse tagasi päringutele.

See lähenemine on eriti kasulik transformaatoreid kasutades, kus partii töötlemine on palju tõhusam kui üksikud päringud.