Mit lehet tenni, amikor hosszabb munka után az ügynök kontextusa fokozatosan megtelik?
Machine Learning / AI
Hogyan tároljuk a LangGraph állapotában az API-n keresztül szerzett nagy mennyiségű információt, használjuk az eszközön belül, de ne adjunk át felesleges adatokat az LLM kontextusába? Például az LLM csak az szakemberek azonosítóját és nevét látja, míg az eszköz megkapja az ütemezésüket és további adatokat.
Hogyan értékelhető a riasztórendszer/incidensnyomozó rendszer munkájának minősége?
Hogyan lehet gyakorlatban elérni, hogy egy modell egy adott mezőben csak egy rövid sztring ID listából származó értékeket generáljon, és semmilyen más szimbólumot?
Hogyan taníthatunk egy LLM-et arra, hogy ne válaszoljon, ha nincs információ a kontextusban?
Általánosságban mit szeretnél csinálni?
Mit lehet tenni, ha egy telepített agent túl lassan válaszol, vagy nincs elég memória az LLM elhelyezéséhez?
Hogyan lehet a kódszinten átadni egy modell sémát strukturált kimenethez?
Meséljen többet a KV-cache-ről: hogyan működik és honnan származik, kezdve a Transformer architektúrával.
Hogyan valósította meg és telepítette a pull request feldolgozó szolgáltatást?
Az orchestrátor látja az al-agens eszközök hívásainak eredményeit, vagy csak az al-agens saját végső kimenetét?
Ki vett részt a modellek hangolásában?
Milyen egyéb optimalizációs módszerek használhatók az inference gyorsítására vagy legalább a modell 12 GB VRAM-on való elhelyezésére az RTX 3090-en?
Hogyan ellenőrizhető, hogy az LLM-as-a-Judge helyesen értékeli a minőséget, és hogyan kalibrálható?
Hogyan épül fel az orchestrátor: melyik keretrendszer és architektúra van használatban, mit csinál, egylépcsős vagy többször gondolkodik-e válaszadás előtt?
Hogyan érhető el formalizált, strukturált válasz, például strukturált kimenet használatakor?
Milyen mintavételi lehetőségek vannak az új tokenekhez az LLM-ben?
Mi a jelenlegi csapat összetétele?