Čo by ste chceli robiť všeobecne?
Machine Learning / AI
Čo možno urobiť, keď sa pri dlhšej práci agentov kontext postupne zapĺňa?
Ako uložiť v stave LangGraph veľké množstvo informácií získaných cez API, použiť ich v nástroji, ale ne prenášať zbytočné údaje do kontextu LLM? Napríklad, LLM vidí iba ID a mená odborníkov, zatiaľ čo nástroj dostáva ich rozvrh a doplnkové údaje.
Ako hodnotiť kvalitu práce systému sledovania/vyšetrovania incidentov?
Ako trénovať LLM, aby neodpovedal, keď v kontexte nie sú žiadne informácie?
Ako v praxi zabezpečiť, aby model v konkrétnom poli generoval iba hodnoty z krátkeho zoznamu ID-ov reťazcov a žiadne iné znaky?
Čo môžete urobiť, ak nasadený agent odpovedá príliš pomaly alebo nemá dostatok pamäte na umiestnenie LLM?
Kto sa podieľal na ladení modelov?
Ako na úrovni kódu odovzdať schému modelu pre štruktúrovaný výstup?
Povedzte nám viac o KV cache: ako funguje a odkiaľ pochádza, začínajúc architektúrou Transformer.
Ako ste implementovali a nasadili službu na spracovanie pull requestov?
O orchestrátor vidí výsledky volaní nástrojov subagent alebo iba konečný výstup samotného subagenta?
Aké ďalšie metódy optimalizácie je možné použiť na zrýchlenie inferenčného procesu alebo aspoň na umiestnenie modelu do 12 GB VRAM na RTX 3090?
Ako overiť, že LLM-as-a-Judge správne hodnotí kvalitu a ako ju kalibrovať?
Ako je zostavený orchestrátor: aký rámec a architektúra sa používajú, čo robí, je jednorazový alebo môže niekoľkokrát premýšľať pred odpoveďou?
Ako dosiahnuť formalizovanú, štruktúrovanú odpoveď, napríklad pri použití štruktúrovaného výstupu?
Aké sú možnosti odberu vzoriek nových tokenov v LLM?
Aké je zloženie vášho súčasného tímu?