Czy w asynchronicznym kodzie Pythona może wystąpić race condition?
Python
Ile dokumentów odzyskano podczas wyszukiwania? Czy był re-ranking?
Jak działała semantyczna pamięć podręczna w Redis?
Jak oceniano jakość pracy systemu RAG?
Jak monitorowałeś pracę usługi? Co oglądałeś w Grafana?
Co jeszcze można zoptymalizować w metodzie predict? (tworzenie DataFrame za każdym razem)
Dlaczego lepiej używać POST zamiast GET dla tego endpointu?
Napisać serwis internetowy w FastAPI, który przyjmuje żądanie POST z danymi (dochód, wiek, kwota kredytu) i zwraca prognozę modelu ML (zatwierdzenie kredytu)
Jak zoptymalizować usługę, aby synchroniczne zadanie CPU (model predykcyjny) nie blokowało pętli zdarzeń FastAPI?
Opowiedz mi o całym pipeline systemu RAG: jakie dokumenty były używane, jak były ładowane i przetwarzane?
Czym jest Singleton i jak go zastosować do ładowania modelu? Jakie są wady Singleton?
Ile czasu zajęła cała linia RAG od zapytania do odpowiedzi?
Jak dokumenty były ładowane do bazy danych wektorowej? Jak przebiegało chunkowanie?
Jaki problem się pojawia i jak go rozwiązać, jeśli w asynchronicznej usłudze używany jest lokalny model ML (np. reranker), który jest wywoływany synchronicznie?
Jak uzyskiwano osadzenia? Za pomocą jakiego modelu i jak był uruchamiany?
Jak działa wielowątkowość w Pythonie z uwzględnieniem GIL? Czym różnią się wątki od procesów?