Как може да се оцени качеството на работата на системата за мониторинг/разследване на инциденти?
Machine Learning / AI
Как да запазя в състоянието на LangGraph голямо количество информация, получена чрез API, да я използвам вътре в инструмента, но без да предавам излишни данни в контекста на LLM? Например, LLM вижда само ID и имената на специалистите, докато инструментът получава техния график и допълнителни данни.
Как да обучим LLM да не отговаря, когато няма информация в контекста?
Как на практика да накарате модел в конкретно поле да генерира само стойности от кратък списък с низови ID и никакви други символи?
Какво бихте искали да правите като цяло?
Как на ниво код да предадете схема на модел за структурирано изход?
Разкажете повече за KV кеша: как работи и откъде идва, започвайки с архитектурата Transformer.
Какво може да се направи, ако разгръщаният агент отговаря твърде бавно или няма достатъчно памет за разполагане на LLM?
Как реализирахте и разположихте услугата за обработка на pull request-и?
Оркестраторът вижда резултатите от обажданията на инструментите на субагента или само крайния изход на самия субагент?
Какви още методи за оптимизация могат да се използват, за да се ускори инференсът или поне да се постави моделът в 12 GB VRAM на RTX 3090?
Как да проверите дали LLM-as-a-Judge правилно оценява качеството и как да го калибрирате?
Как е построен оркестраторът: какъв фреймуърк и архитектура се използват, какво прави, едноетапен ли е или може да размишлява няколко пъти преди да отговори?
Как да постигнете формализиран, структуриран отговор, например при използване на структурирано изходно данни?
Защо решихте да напуснете текущата си работа?
Кой участва в настройката на моделите?
Какъв е текущият състав на вашия екип?
Как растежът на диалога и контекста влияе върху скоростта на обработка на отговорите?