Ha az eszköz (backend) maga hibázott (például időtúllépés a rendszerhez való hozzáféréskor), továbbították-e a hibák traceback-jét a modelleknek?
Machine Learning / AI
Milyen adathalmazon mérték a modell kiválasztási metrikákat?
Hogyan követték nyomon az egész multi-agens rendszert — mely szakaszokban fordulnak elő hibák, késleltetés stb.?
Teszteltél más embedding-modelleket?
Mivel mértek a retrive metrikákat (milyen adathalmaz és eszköz)?
Volt-e ellenőrzés a rendszerben az ismétlődésekre sikeres bejegyzés után (idempotencia)?
Mekkora volt a chunk mérete, és történt-e átfedés?
Miért nem használták a Human-in-the-Loop-ot a multiügynökrendszerben, csak a ReAct-ben?
Mi az a BERT és milyen feladatokon tanult?
Írja le a ReAct-ügynök ciklusát: mik voltak a lépések és hogyan végződött a ciklus?
Milyen típusú jelöléseket ismersz a NER feladathoz? Mivel dolgoztál?
Mi az a VLM (Látásnyelvi Modell)?
Sebesség szempontjából, mi lesz gyorsabb — egy egyszerű ügynök eszközökkel vagy egy multi-ügynökrendszer?
Melyik részben (BM25 vagy dense) nincsenek normalizálva az értékek?
Milyen volt a toolcalling: natív vagy prompt (parsing) segítségével?
Egy modellt használt minden ügynöknél, vagy különbözőeket?
És mit tettek, ha a modell érvénytelen argumentumot adott?
Mi a különbség a fine-tuning és a few-shot prompting között? Mit és mikor válasszunk?
Hogyan jelezték a modellek, hogy az argumentum érvénytelen?
Volt párhuzamosság az ügynökök végrehajtásában, vagy minden szekvenciális volt?