Kann es in asynchronem Python-Code zu einem Race Condition kommen?
Python
Wie viele Dokumente wurden bei der Suche abgerufen? Gab es ein Re-Ranking?
Wie funktionierte der semantische Cache in Redis?
Wie wurde die Qualität der Arbeit des RAG-Systems bewertet?
Wie haben Sie den Betrieb des Dienstes überwacht? Was haben Sie in Grafana angesehen?
Was kann noch im predict-Methoden optimiert werden? (Erstellung des DataFrame jedes Mal)
Warum ist es besser, POST anstelle von GET für diesen Endpunkt zu verwenden?
Einen Web-Service in FastAPI schreiben, der eine POST-Anfrage mit Daten (Einkommen, Alter, Kreditbetrag) entgegennimmt und die Vorhersage des ML-Modells (Kreditgenehmigung) zurückgibt
Wie optimiert man den Service, damit eine synchrone CPU-Aufgabe (Vorhersagemodell) die Event Loop von FastAPI nicht blockiert?
Erzählen Sie mir den gesamten Pipeline des RAG-Systems: Welche Dokumente wurden verwendet, wie wurden sie geladen und verarbeitet?
Was ist Singleton und wie wird es zur Modellladung angewendet? Welche Nachteile hat Singleton?
Wie lange hat die gesamte RAG-Pipeline von der Anfrage bis zur Antwort gedauert?
Wie wurden die Dokumente in die Vektor-Datenbank geladen? Wie erfolgte das Chunking?
Welches Problem tritt auf und wie kann man es lösen, wenn in einem asynchronen Dienst ein lokales ML-Modell (z.B. ein Reranker) verwendet wird, das synchron aufgerufen wird?
Wie wurden die Embeddings erstellt? Mit welchem Modell und wie wurde es gestartet?
Wie funktioniert Multithreading in Python unter Berücksichtigung des GIL? Worin unterscheiden sich Threads von Prozessen?