Sobes.tech
Middle — Senior

Чӣ гуна batching-и пайваста ва чӣ гуна дар vLLM/TGI амалӣ мешавад?

sobes.tech AI

Ҷавоб аз AI

Үздіксіз топтау — бұл машиналық оқыту моделіне сұрауларды өңдеу техникасы, онда кіретін inference сұраулары үздіксіз және динамикалық түрде топтарға жиналады, бұл есептеу ресурстарын барынша тиімді пайдалану және кідірістерді азайту үшін. Белгілі бір уақыт немесе сұраулардың белгілі бір санын күтудің орнына, жүйе үнемі келіп түсетін сұраулардан топтар құрып, оларды өңдейді.

vLLM және TGI (Text Generation Inference) ішінде үздіксіз топтау асинхронды күтім және динамикалық топ құру арқылы жүзеге асырылады. Мысалы, сұрау келгенде, ол кезекке қойылады, және қозғалтқыш бірнеше сұраудан тұратын топ құруға тырысады, бірінші сұрауды тым ұзақ күтпестен. Егер жаңа сұраулар болмаса, топ бар болғанымен іске қосылады. Бұл бірнеше сұрауды бір уақытта өңдеуге, GPU-ны тиімді пайдалануға және әр сұраудың кідірісін азайтуға мүмкіндік береді.

Шамамен, ол былай көрінеді:

  • Сұраулар кезекке түседі.
  • Жүйе максималды топ өлшеміне жеткенше немесе уақыт шегі өтіп кеткенше күтеді.
  • Топ құрылады және модельге жіберіледі.
  • Нәтижелер сұрауларға қайта таратылады.

Бұл тәсіл трансформаторлар үшін әсіресе пайдалы, себебі топтау өңдеу бір сұрауға қарағанда әлдеқайда тиімді.