Est-il possible qu'une condition de course se produise dans le code asynchrone Python?
Python
Combien de documents ont été récupérés lors de la recherche ? Y a-t-il eu un re-ranking ?
Comment fonctionnait le cache sémantique dans Redis?
Comment la qualité du travail du système RAG a-t-elle été évaluée?
Comment avez-vous surveillé le fonctionnement du service ? Qu'avez-vous regardé dans Grafana ?
Que peut-on encore optimiser dans la méthode predict ? (création de DataFrame à chaque fois)
Pourquoi est-il préférable d'utiliser POST plutôt que GET pour ce point de terminaison?
Écrire un service web sur FastAPI qui accepte une requête POST avec des données (revenu, âge, montant du prêt) et renvoie la prédiction du modèle ML (approbation du prêt)
Comment optimiser le service pour qu'une tâche synchrone de CPU (modèle de prédiction) ne bloque pas la boucle d'événements de FastAPI?
Parlez-moi de tout le pipeline du système RAG : quels documents ont été utilisés, comment ils ont été chargés et traités ?
Qu'est-ce que Singleton et comment l'appliquer pour charger un modèle ? Quels sont les inconvénients de Singleton ?
Combien de temps a duré l'ensemble du pipeline RAG, de la requête à la réponse?
Comment les documents ont-ils été chargés dans la base de données vectorielle ? Comment s'est déroulé le découpage ?
Quel problème survient et comment le résoudre si un service asynchrone utilise un modèle ML local (par exemple, un reranker) qui est appelé de manière synchrone?
Comment les embeddings ont-ils été obtenus ? À l'aide de quel modèle et comment était-il lancé ?
Comment fonctionne la multitâche en Python avec le GIL ? En quoi les threads diffèrent-ils des processus ?