Può verificarsi una condizione di race nel codice asincrono Python?
Python
Quanti documenti sono stati recuperati durante la ricerca? C'è stato un re-ranking?
Come è stata valutata la qualità del lavoro del sistema RAG?
Come funzionava la cache semantica in Redis?
Come hai monitorato il funzionamento del servizio? Cosa hai guardato in Grafana?
Cosa si può ancora ottimizzare nel metodo predict? (creazione del DataFrame ogni volta)
Come ottimizzare il servizio affinché un task CPU sincrono (modello di previsione) non blocchi l'event loop di FastAPI?
Perché è meglio usare POST invece di GET per questo endpoint?
Scrivere un servizio web su FastAPI che accetta una richiesta POST con dati (reddito, età, importo del prestito) e restituisce la previsione del modello ML (approvazione del prestito)
Cos'è Singleton e come applicarlo per caricare un modello? Quali sono gli svantaggi di Singleton?
Puoi raccontarmi tutto il pipeline del sistema RAG: quali documenti sono stati usati, come sono stati caricati e processati?
Quanto tempo ha impiegato l'intero pipeline RAG dalla richiesta alla risposta?
Come sono stati caricati i documenti nel database vettoriale? Come è avvenuto il chunking?
Qual è il problema che si presenta e come risolverlo se in un servizio asincrono si utilizza un modello ML locale (ad esempio, un reranker) chiamato in modo sincrono?
Come sono stati ottenuti gli embedding? Attraverso quale modello e come è stato avviato?
Come funziona il multithreading in Python considerando il GIL? In cosa si differenziano i thread dai processi?