Comment avez-vous tracé tout le système multi-agent : à quelles étapes apparaissent des erreurs, de la latence, etc. ?
Machine Learning / AI
Si l'outil (backend) faisait une erreur (par exemple, un timeout lors de l'accès au système), les traces d'erreur étaient-elles transmises aux modèles?
Y avait-il une vérification de duplication dans le système en cas de panne après une écriture réussie (idempotence) ?
Sur quoi ont été mesurées les métriques de sélection du modèle (quel jeu de données) ?
Avez-vous testé d'autres modèles d'embedding?
Sur quoi ont été mesurées les métriques de retrive (quel dataset et quel outil) ?
Quelle était la taille du fragment et y avait-il un chevauchement?
Pourquoi dans le système multi-agent, Human-in-the-Loop n'a été utilisé que dans ReAct ?
Qu'est-ce que BERT et sur quelles tâches a-t-il été entraîné ?
Décrivez le cycle de l'agent ReAct : quelles étaient les étapes et comment se terminait le cycle ?
Quels types d'annotations pour la tâche NER connais-tu ? Avec quoi as-tu travaillé ?
Qu'est-ce que VLM (Modèle de Langage Visuel) ?
En termes de vitesse, qu'est-ce qui sera plus rapide : un agent simple avec des outils ou un système multi-agent ?
Dans quelle partie (BM25 ou dense) les valeurs ne sont-elles pas normalisées?
Quel était le toolcalling : natif ou via prompt (parsing) ?
Et que faisiez-vous si le modèle donnait un argument non valide?
Avez-vous utilisé un seul modèle pour tous les agents ou différents ?
Comment les modèles ont-ils signalé que l'argument n'est pas valide?
Quelle est la différence entre fine-tuning et few-shot prompting ? Que et quand choisir ?
Comment décriviez-vous les outils ? Quel est le format général et les exigences principales pour la description ?