¿Puede ocurrir una condición de carrera en el código asíncrono de Python?
Python
¿Cuántos documentos recuperaron durante la búsqueda? ¿Hubo re-ranking?
¿Cómo se evaluó la calidad del trabajo del sistema RAG?
¿Cómo funcionaba la caché semántica en Redis?
¿Cómo monitoreaste el funcionamiento del servicio? ¿Qué viste en Grafana?
¿Qué más se puede optimizar en el método predict? (crear DataFrame cada vez)
¿Por qué es mejor usar POST en lugar de GET para este endpoint?
Escribir un servicio web en FastAPI que acepte una solicitud POST con datos (ingresos, edad, monto del préstamo) y devuelva la predicción del modelo ML (aprobación del préstamo)
¿Cómo optimizar el servicio para que una tarea sincrónica de CPU (modelo predictivo) no bloquee el event loop de FastAPI?
¿Puedes contarme todo el pipeline del sistema RAG: qué documentos se usaron, cómo se cargaron y procesaron?
¿Qué es Singleton y cómo se aplica para cargar un modelo? ¿Cuáles son las desventajas de Singleton?
¿Cuánto tiempo tomó todo el pipeline RAG desde la solicitud hasta la respuesta?
¿Qué problema surge y cómo se resuelve si en un servicio asíncrono se utiliza un modelo ML local (por ejemplo, un reranker) que se llama de forma síncrona?
¿Cómo se cargaron los documentos en la base de datos vectorial? ¿Cómo se realizó el fragmentado?
¿Cómo se obtuvieron los embeddings? ¿A través de qué modelo y cómo se ejecutaba?
¿Cómo funciona la multitarea en Python teniendo en cuenta el GIL? ¿En qué se diferencian los hilos de los procesos?