¿Cómo se puede evaluar la calidad del trabajo del sistema de monitoreo/investigación de incidentes?
Machine Learning / AI
¿Cómo guardar en el estado de LangGraph una gran cantidad de información obtenida a través de la API, usarla dentro de la herramienta, pero sin pasar datos innecesarios al contexto de LLM? Por ejemplo, LLM solo ve el ID y los nombres de los especialistas, mientras que la herramienta recibe su horario y datos adicionales.
¿Cómo entrenar a un LLM para que no responda cuando no tiene información en el contexto?
¿Cómo hacer que en la práctica un modelo en un campo específico genere solo valores de una lista corta de ID de cadenas y ningún otro símbolo?
¿Qué te gustaría hacer en general?
¿Cómo pasar un esquema de modelo para salida estructurada a nivel de código?
¿Qué se puede hacer si un agente desplegado responde demasiado lentamente o no hay suficiente memoria para alojar un LLM?
Cuéntenos más sobre la caché KV: cómo funciona y de dónde proviene, comenzando con la arquitectura Transformer.
¿Cómo implementó y desplegó el servicio para procesar pull requests?
¿El orquestador ve los resultados de las llamadas a las herramientas del subagente o solo la salida final del propio subagente?
¿Qué otros métodos de optimización se pueden utilizar para acelerar la inferencia o al menos colocar el modelo en 12 GB de VRAM en una RTX 3090?
¿Cómo verificar que LLM-as-a-Judge evalúa correctamente la calidad y cómo calibrarla?
¿Cómo lograr una respuesta formalizada y estructurada, por ejemplo, al usar output estructurado?
¿Cómo está construido el orquestador: qué marco y arquitectura se utilizan, qué hace, es de un solo paso o puede razonar varias veces antes de responder?
¿Por qué decidiste dejar tu trabajo actual?
¿Quién estuvo involucrado en la afinación de los modelos?
¿Cuál es la composición actual de tu equipo?
¿Cómo afecta el crecimiento del diálogo y el contexto a la velocidad de procesamiento de respuestas?