Kaip sekėte visą daugelio agentų sistemą – kokiose etapose kyla klaidos, vėlavimai ir kt.?
Machine Learning / AI
Jei įrankis (backend) pats klydo (pavyzdžiui, laiko limitas prie sistemos), ar klaidų traceback'ai buvo perduoti modeliams?
Ar sistemoje buvo patikrinta dubliacija po sėkmingo įrašo klaidos atveju (idempotency)?
Kuo matuojamos modelio pasirinkimo metrikos (koks duomenų rinkinys)?
Ar bandėte kitus embedding modelius?
Kuo matuojamos retrive metrikos (koks duomenų rinkinys ir įrankis)?
Koks buvo gabalo dydis ir ar buvo overlap (perdengimas)?
Kodėl daugiaagentinėje sistemoje nebuvo naudojamas Human-in-the-Loop, tik ReAct?
Kas yra BERT ir kokiose užduotyse jis buvo mokomas?
Aprašykite ReAct agento ciklą: kokie buvo žingsniai ir kaip baigdavosi ciklas?
Kokius žymėjimo tipus žinai NER užduočiai? Su kuo dirbai?
Kas yra VLM (Vaizdinės Kalbos Modelis)?
Greičio požiūriu, kas bus greičiau — paprastas agentas su įrankiais ar daugiaagentinė sistema?
Kuriame skyriuje (BM25 ar dense) reikšmės nėra normalizuotos?
Koks buvo toolcallingas: natūralus ar per promptą (parsing)?
O jei modelis pateikdavo negaliojantį argumentą — ką darydavote?
Naudojote vieną modelį visiems agentams ar skirtingus?
Kaip modeliai pranešė, kad argumentas yra neteisingas?
Kuo skiriasi fine-tuning ir few-shot prompting? Ką ir kada pasirinkti?
Kaip apibūdindavote įrankius? Koks bendras formatas ir pagrindiniai reikalavimai aprašymui?