Əgər alət (backend) özü səhv edibsə (məsələn, sistemə müraciət zamanı zaman aşımı), səhv traceback-ləri modellərə ötürülüb?
Machine Learning / AI
Model seçimi metrikləri hansı məlumat dəstində ölçüldü?
Başqa embedding modellərini sınaqdan keçirdinizmi?
Uğurlu qeydiyyatdan sonra sistemdə təkrarlanma yoxlaması edildi mi (idempotency)?
Parçanın ölçüsü nə idi və overlap (örtüşmə) edildi mi?
Retrive metrikləri nə ilə ölçüldü (hansı dataset və hansı alət)?
Çox agentli sistemdə niyə Human-in-the-Loop istifadə olunmayıb, yalnız ReAct-də?
ReAct agentinin dövrünü təsvir edin: hansı addımlar idi və dövr necə başa çatırdı?
Bütün çox agentli sistemi necə izlədilər — hansı mərhələlərdə səhvlər, gecikmələr və s. yaranır?
NER tapşırığı üçün hansı işarələmə növlərini bilirsiniz? Nə ilə işlədiniz?
Sürət baxımından, daha sürətli nə olacaq — alətlərlə sadə agent yoxsa çox agentli sistem?
Toolcalling nə idi: yerli və ya prompt vasitəsilə (parsing)?
Hansı hissədə (BM25 və ya dense) dəyərlər normallaşdırılmayıb?
VLM (Görmə Dili Modeli) nədir?
Bütün agentlər üçün eyni modeli və ya fərqli modellər istifadə etdinizmi?
Fine-tuning və few-shot prompting arasındakı fərq nədir? Nə və nə vaxt seçmək lazımdır?
Və model etibarsız arqument verəndə nə edirdiniz?
Modellər arqumentin etibarsız olduğunu necə bildirdi?
BERT nədir və hansı tapşırıqlarda öyrədilib?
Agentlərin icrasında paralellik olubmu yoxsa hər şey ardıcıl olubmu?