¿Si la herramienta (backend) cometía un error (por ejemplo, un timeout al acceder al sistema), se transmitían las trazas de error a los modelos?
Machine Learning / AI
¿En qué se midieron las métricas de selección del modelo (qué conjunto de datos)?
¿Han probado otros modelos de embedding?
¿Hubo una verificación de duplicados en el sistema en caso de fallo después de una escritura exitosa (idempotencia)?
¿Cuál fue el tamaño del fragmento y se hizo solapamiento?
¿En qué se midieron las métricas de retrive (qué conjunto de datos y qué herramienta)?
¿Por qué en el sistema multiagente no se utilizó Human-in-the-Loop, solo en ReAct?
Describe el ciclo del agente ReAct: ¿cuáles fueron los pasos y cómo terminaba el ciclo?
¿Cómo rastrearon todo el sistema multiagente: en qué etapas surgen errores, latencia, etc.?
¿Qué tipos de anotaciones para la tarea de NER conoces? ¿Con qué has trabajado?
En términos de velocidad, ¿qué será más rápido: un agente simple con herramientas o un sistema multiagente?
¿Cuál fue toolcalling: nativo o a través de prompt (análisis)?
¿En qué parte (BM25 o dense) los valores no están normalizados?
¿Qué es VLM (Modelo de Lenguaje Visual)?
¿ Utilizaron un solo modelo para todos los agentes o diferentes?
¿Y qué hacían si el modelo proporcionaba un argumento no válido?
¿Cuál es la diferencia entre fine-tuning y few-shot prompting? ¿Qué y cuándo elegir?
¿Qué es BERT y en qué tareas se entrenó?
¿Cómo informaron las modelos que el argumento no es válido?
¿Hubo paralelismo en la ejecución de los agentes o todo fue secuencial?