Ja rīks (backend) pats kļūdījās (piemēram, laika pārtraukums, piekļūstot sistēmai), vai kļūdu traceback-i tika nodoti modeļiem?
Machine Learning / AI
Vai sistēmā bija pārbaude par dublēšanu pēc veiksmīgas ieraksta kļūmes gadījumā (idempotence)?
Ar ko tika mērītas modeļa izvēles metriku (kura datu kopums)?
Kā jūs izsekojāt visu multiagentu sistēmu – kādos posmos rodas kļūdas, latentums utt.?
Vai esat testējuši citus embedding modeļus?
Ar ko tika mērītas retrive metrikas (kāds datu kopums un rīks)?
Kāpēc daudzagentu sistēmā netika izmantots Human-in-the-Loop, tikai ReAct?
Kāda bija gabala lielums un vai bija overlap (pārklāšanās)?
Kas ir BERT un uz kādiem uzdevumiem tas tika apmācīts?
Aprakstiet ReAct aģenta ciklu: kādi bija soļi un kā cikls beidzās?
Kādus marķēšanas veidus pazīsti NER uzdevumam? Ar ko esi strādājis?
Kas ir VLM (Vizuālās Valodas Modelis)?
Ātruma ziņā, kas būs ātrāk — vienkāršs aģents ar rīkiem vai daudzagentu sistēma?
Kādā daļā (BM25 vai dense) vērtības nav normalizētas?
Kāda bija toolcalling: iebūvēta vai caur promptu (parsing)?
Vai izmantojāt vienu modeli visiem aģentiem vai dažādus?
Un ja modelis sniedza nederīgu argumentu — ko darījāt?
Kā modeļi ziņoja, ka arguments nav derīgs?
Kāda ir atšķirība starp fine-tuning un few-shot prompting? Ko un kad izvēlēties?
Vai darbā ar aģentiem bija paralēlisms vai viss notika secīgi?