Sobes.tech
Middle — Senior

რა არის უწყვეტი ბეტჩინგი და როგორ ხორციელდება vLLM/TGI-ში?

sobes.tech AI

პასუხი AI-სგან

Үздіксіз топтау — бұл машиналық оқыту моделіне сұрауларды өңдеу техникасы, онда кіретін inference сұраулары үздіксіз және динамикалық түрде топтарға жиналады, бұл есептеу ресурстарын барынша тиімді пайдалану және кідірістерді азайту үшін. Белгілі бір уақыт немесе сұраулардың белгілі бір санын күтудің орнына, жүйе үнемі келіп түсетін сұраулардан топтар құрып, оларды өңдейді.

vLLM және TGI (Text Generation Inference) ішінде үздіксіз топтау асинхронды күтім және динамикалық топ құру арқылы жүзеге асырылады. Мысалы, сұрау келгенде, ол кезекке қойылады, және қозғалтқыш бірнеше сұраудан тұратын топ құруға тырысады, бірінші сұрауды тым ұзақ күтпестен. Егер жаңа сұраулар болмаса, топ бар болғанымен іске қосылады. Бұл бірнеше сұрауды бір уақытта өңдеуге, GPU-ны тиімді пайдалануға және әр сұраудың кідірісін азайтуға мүмкіндік береді.

Шамамен, ол былай көрінеді:

  • Сұраулар кезекке түседі.
  • Жүйе максималды топ өлшеміне жеткенше немесе уақыт шегі өтіп кеткенше күтеді.
  • Топ құрылады және модельге жіберіледі.
  • Нәтижелер сұрауларға қайта таратылады.

Бұл тәсіл трансформаторлар үшін әсіресе пайдалы, себебі топтау өңдеу бір сұрауға қарағанда әлдеқайда тиімді.