Pokud nástroj (backend) sám chyboval (například timeout při přístupu k systému), byly tracebacky chyb předávány modelům?
Machine Learning / AI
Proběhla v systému kontrola duplicit při selhání po úspěšném zápisu (idempotence)?
Na čem byly měřeny metriky výběru modelu (jaký dataset)?
Jak jste sledovali celý multiagentní systém – v jakých fázích se objevují chyby, latence atd.?
Testovali jste jiné embeddingové modely?
Na čem byly měřeny metriky retrive (jaký dataset a nástroj)?
Proč v multiagentním systému nebyl použit Human-in-the-Loop, pouze v ReAct?
Jaká byla velikost chunku a bylo překrytí?
Co je BERT a na jakých úlohách byl trénován?
Popište cyklus agenta ReAct: jaké byly kroky a jak končil cyklus?
Jaké typy označení pro úlohu NER znáš? S čím jsi pracoval?
Co je VLM (Model vizuálního jazyka)?
Z hlediska rychlosti, co bude rychlejší — jednoduchý agent s nástroji nebo multiagentní systém?
V které části (BM25 nebo dense) nejsou hodnoty normalizovány?
Jaký byl toolcalling: nativní nebo přes prompt (parsing)?
Použili jste jeden model pro všechny agenty nebo různé?
A co jste dělali, když model dával neplatný argument?
Jak modely oznámily, že argument není platný?
Jaký je rozdíl mezi fine-tuningem a few-shot promptingem? Co a kdy vybírat?
Byla v provádění agentů paralelní nebo vše bylo sekvenční?