¿Puedes explicar la diferencia entre cross-encoder y bi-encoder?
Machine Learning / AI
¿Cómo determinar si un modelo de incrustaciones funciona bien? ¿Qué métricas se utilizaron?
¿Hay alguna forma de verificar que el texto generado no contiene errores factuales en relación con el original?
¿Cómo se eligió la estrategia de fragmentación (chunking) para el sistema RAG?
¿Cómo se extrajeron los datos de los documentos PDF para el sistema RAG?
¿Cómo probar un servicio implementado en FastAPI?
Cuéntame sobre la cuantificación de modelos: qué es, para qué sirve, qué tipos hay?
Cuéntame sobre las métricas de rendimiento del servicio de ML: latencia, RPS, ¿cómo se organizó esto en tu proyecto?
Cuéntame sobre los parámetros de generación de LLM: temperatura, top-k, top-p y otros.
Cuéntame sobre las bases de datos vectoriales, cuáles existen, en qué se diferencian, por qué eligieron pgvector?
Cuéntame sobre la tarea más difícil o dificultad en uno de los proyectos.
¿Cómo se organizaron los datos para la resumición de diálogos y cómo se llevó a cabo el entrenamiento?
¿Cómo se relacionan Recall y Precision, se puede aumentar uno sin disminuir el otro? Da ejemplos de tareas.
¿Qué método de cuantificación (int8 o float) dañará menos la calidad del modelo?
¿Cómo evaluar la calidad de la resumación?
¿Cómo abordarías la tarea de resumir un diálogo de varias personas en una conferencia (por ejemplo, 10 desarrolladores en Slack)?
¿Qué modelo y enfoque elegir para procesar audio de una conferencia (reconocimiento de voz, diarización)?
Cuéntame sobre LoRA: ¿qué es, para qué sirve?
¿Cómo trabajar con datos privados durante el despliegue local del sistema?
¿Por qué eligieron la búsqueda híbrida BM25 + embeddings en lugar de solo la distancia coseno?