На какъв набор от данни бяха измерени метриките за избор на модел?
Machine Learning / AI
Какво се записваше в метаданните на документите във векторното хранилище?
Имало ли е проверка за дублиране в системата при срив след успешен запис (идемпотентност)?
Какъв беше размерът на парчето и имаше ли припокриване?
На какво са измервани метриките на retrive (кой набор от данни и инструмент)?
Тествахте ли други embedding модели?
Защо в мултиагентната система не е използван Human-in-the-Loop, само в ReAct?
Опишете цикъла на агента ReAct: какви бяха стъпките и как завършваше цикълът?
Какви видове маркиране за задачата NER знаеш? С какво си работил?
Как проследиха цялата мултиагентна система — на кои етапи възникват грешки, латентност и т.н.?
По скорост, кое ще бъде по-бързо — обикновен агент с инструменти или мултиагентна система?
Какво беше toolcalling: нативен или чрез prompt (parsing)?
В коя част (BM25 или dense) стойностите не са нормализирани?
Какво е VLM (Модел за визуален език)?
Използвахте ли една модел за всички агенти или различни?
Каква е разликата между fine-tuning и few-shot prompting? Какво и кога да изберем?
А ако моделът даваше невалиден аргумент — какво правехте?
Как моделите съобщиха, че аргументът е невалиден?
Имало ли е паралелност в изпълнението на агентите или всичко беше последователно?
Как описвахте инструментите? Какъв е общият формат и основните изисквания към описанието?