Se a ferramenta (backend) cometia um erro (por exemplo, um timeout ao aceder ao sistema), as traces de erro eram transmitidas aos modelos?
Machine Learning / AI
Com que conjunto de dados foram medidos os métricas de seleção de modelo?
Testaram outros modelos de embedding?
Houve uma verificação de duplicação no sistema em caso de falha após uma gravação bem-sucedida (idempotência)?
Qual foi o tamanho do fragmento e houve sobreposição?
Em que foram medidas as métricas de retrive (qual dataset e qual ferramenta)?
Por que no sistema multiagente não foi utilizado Human-in-the-Loop, apenas no ReAct?
Descreva o ciclo do agente ReAct: quais foram as etapas e como terminava o ciclo?
Como rastrearam todo o sistema multiagente — em que etapas surgem erros, latência, etc.?
Que tipos de marcações para a tarefa de NER conheces? Com o que trabalhaste?
Em termos de velocidade, o que será mais rápido — um agente simples com ferramentas ou um sistema multiagente?
Qual foi o toolcalling — nativo ou através de prompt (parsing)?
Em qual parte (BM25 ou dense) os valores não estão normalizados?
O que é VLM (Modelo de Linguagem Visual)?
Usaram um modelo único para todos os agentes ou diferentes?
Qual é a diferença entre fine-tuning e few-shot prompting? O que e quando escolher?
E se o modelo fornecesse um argumento inválido — o que faziam?
Como as modelos informaram que o argumento não é válido?
O que é o BERT e em que tarefas ele foi treinado?
Houve paralelismo na execução dos agentes ou tudo foi sequencial?