Se lo strumento (backend) commetteva un errore (ad esempio, un timeout durante l'accesso al sistema), venivano trasmesse le tracce di errore ai modelli?
Machine Learning / AI
Su cosa sono state misurate le metriche di selezione del modello (quale dataset)?
Hai testato altri modelli di embedding?
È stata effettuata una verifica di duplicazione nel sistema in caso di errore dopo una registrazione riuscita (idempotenza)?
Qual era la dimensione del chunk e c'era sovrapposizione?
Su cosa sono state misurate le metriche di retrive (quale dataset e quale strumento)?
Perché nel sistema multi-agente non è stato utilizzato Human-in-the-Loop, solo in ReAct?
Descrivi il ciclo dell'agente ReAct: quali sono stati i passaggi e come si concludeva il ciclo?
Come avete tracciato tutto il sistema multi-agente: in quali fasi si verificano errori, latenza, ecc.?
Quali tipi di annotazioni per il compito NER conosci? Con cosa hai lavorato?
In termini di velocità, cosa sarà più veloce: un agente semplice con strumenti o un sistema multi-agente?
Qual è stato il toolcalling: nativo o tramite prompt (parsing)?
In quale parte (BM25 o dense) i valori non sono normalizzati?
Cos'è VLM (Modello di Linguaggio Visivo)?
Hai usato un solo modello per tutti gli agenti o diversi?
Qual è la differenza tra fine-tuning e few-shot prompting? Cosa e quando scegliere?
E se il modello forniva un argomento non valido — cosa facevate?
Come hanno segnalato i modelli che l'argomento non è valido?
Cos'è BERT e su quali compiti è stato addestrato?
C'è stata parallelizzazione nell'esecuzione degli agenti o tutto è stato sequenziale?