Machine Learning / AI
Jak uložit do stavu LangGraph velké množství informací získaných přes API, použít je uvnitř nástroje, ale nezahrnovat zbytečná data do kontextu LLM? Například LLM vidí pouze ID a jména odborníků, zatímco nástroj obdrží jejich rozvrh a doplňující údaje.
Jaký je váš současný status jako kandidáta? Pracujete nebo jste odešel?
Jak v praxi zajistit, aby model v konkrétním poli generoval pouze hodnoty z krátkého seznamu řetězcových ID a žádné jiné znaky?
Jak trénovat LLM, aby ne odpovídal, když v kontextu není žádná informace?
Jak na úrovni kódu předat schéma modelu pro strukturovaný výstup?
Co lze udělat, pokud nasazený agent odpovídá příliš pomalu nebo není dostatek paměti pro umístění LLM?
Vidí orchestrátor výsledky volání nástrojů subagenta nebo pouze konečný výstup samotného subagenta?
Jak jste implementovali a nasadili službu pro zpracování pull requestů?
Povězte nám více o KV cache: jak funguje a odkud pochází, začínaje architekturou Transformer.
Jaké další metody optimalizace lze použít k urychlení inference nebo alespoň k umístění modelu do 12 GB VRAM na RTX 3090?
Jak ověřit, že LLM-as-a-Judge správně hodnotí kvalitu a jak ji kalibrovat?
Jak dosáhnout formalizované, strukturované odpovědi, například při použití strukturovaného výstupu?
Jak je orchestrátor postaven: jaký rámec a architektura jsou použity, co dělá, je to jednopásmový nebo může několikrát přemýšlet před odpovědí?
Jak růst dialogu a kontextu ovlivňuje rychlost zpracování odpovědí?
Jaké jsou možnosti vzorkování nových tokenů v LLM?
V čem se liší dense- a MoE-modely, například Qwen3-27B a Qwen3-30B-A3B?
Co je třeba udělat po retrievalu, aby se vytvořila odpověď uživateli, a jak hodnotit kvalitu generování v RAG?
Kdo se podílel na ladění modelů?