Kan er een raceconditie ontstaan in asynchrone Python-code?
Python
Hoeveel documenten werden tijdens de zoektocht opgehaald? Was er een re-ranking?
Hoe werkte de semantische cache in Redis?
Hoe werd de kwaliteit van het werk van het RAG-systeem beoordeeld?
Hoe heb je de werking van de service gemonitord? Wat heb je in Grafana bekeken?
Wat kan er nog meer geoptimaliseerd worden in de predict-methode? (elke keer een DataFrame maken)
Waarom is het beter om POST te gebruiken in plaats van GET voor deze endpoint?
Schrijf een webservice op FastAPI die een POST-verzoek met gegevens (inkomen, leeftijd, kredietbedrag) accepteert en de voorspelling van het ML-model (kredietgoedkeuring) teruggeeft
Hoe optimaliseer je de service zodat een synchrone CPU-taak (voorspellingsmodel) de event loop van FastAPI niet blokkeert?
Vertel me over de hele pipeline van het RAG-systeem: welke documenten werden gebruikt, hoe werden ze geladen en verwerkt?
Wat is een Singleton en hoe pas je het toe voor het laden van een model? Wat zijn de nadelen van een Singleton?
Hoe lang duurde de hele RAG-pijplijn van aanvraag tot antwoord?
Hoe werden de documenten in de vector database geladen? Hoe verliep het chunking proces?
Welke problemen ontstaan en hoe los je ze op als in een asynchrone service een lokaal ML-model (bijvoorbeeld een reranker) wordt gebruikt dat synchronisch wordt aangeroepen?
Hoe werden de embeddings verkregen? Via welk model en hoe werd het uitgevoerd?
Hoe werkt multithreading in Python met inachtneming van de GIL? Hoe verschillen threads van processen?