Dacă instrumentul (backend) a greșit singur (de exemplu, timeout la accesarea sistemului), au fost transmise traceback-urile de eroare modelelor?
Machine Learning / AI
Pe ce set de date au fost măsurate metricile de selecție a modelului?
Ați testat alte modele de embedding?
A fost o verificare pentru duplicare în sistem în cazul unei erori după o înregistrare reușită (idempotency)?
Care a fost dimensiunea chunk-ului și s-a făcut suprapunere?
Pe ce s-au măsurat metricile de retrive (ce set de date și ce instrument)?
De ce în sistemul multi-agent nu s-a folosit Human-in-the-Loop, doar în ReAct?
Descrie ciclul agentului ReAct: care au fost pașii și cum se încheia ciclul?
Cum ați urmărit întregul sistem multi-agent — în ce etape apar erori, latență etc.?
Ce tipuri de marcaje pentru sarcina NER cunoști? Cu ce ai lucrat?
Din punct de vedere al viteză, ce va fi mai rapid — un agent simplu cu unelte sau un sistem multi-agent?
Care a fost toolcalling-ul: nativ sau prin prompt (parsing)?
În ce parte (BM25 sau dense) valorile nu sunt normalizate?
Ce este VLM (Modelul de Limbaj Vizual)?
Ați folosit un singur model pentru toți agenții sau diferite?
Care este diferența dintre fine-tuning și few-shot prompting? Ce și când să alegi?
Și dacă modelul oferea un argument invalid — ce făceau?
Cum au raportat modelele că argumentul nu este valid?
Ce este BERT și pe ce sarcini a fost antrenat?
A fost paralelism în executarea agenților sau totul a fost secvențial?