Poate apărea o condiție de cursă în codul asincron Python?
Python
Câte documente au fost recuperate în timpul căutării? A fost re-ranking?
Cum a fost evaluată calitatea muncii sistemului RAG?
Cum funcționa cache-ul semantic în Redis?
Cum ai monitorizat funcționarea serviciului? Ce ai urmărit în Grafana?
Ce altceva se poate optimiza în metoda predict? (crearea DataFrame-ului de fiecare dată)
Cum se optimizează serviciul pentru ca o sarcină CPU sincrona (model de predicție) să nu blocheze event loop-ul FastAPI?
De ce este mai bine să folosiți POST în loc de GET pentru acest endpoint?
Scrieți un serviciu web pe FastAPI care acceptă o solicitare POST cu date (venit, vârstă, suma creditului) și returnează predicția modelului ML (aprobare credit)
Ce este Singleton și cum îl aplici pentru încărcarea unui model? Care sunt dezavantajele Singleton-ului?
Povesti-mi despre întregul pipeline al sistemului RAG: ce documente au fost folosite, cum au fost încărcate și procesate?
Cât timp a durat întregul pipeline RAG de la solicitare până la răspuns?
Cum au fost încărcate documentele în baza de date vectorială? Cum a avut loc chunking-ul?
Care este problema care apare și cum se rezolvă dacă într-un serviciu asincron se folosește un model ML local (de exemplu, un reranker) care este apelat sincron?
Cum au fost obținute embedding-urile? Prin ce model și cum a fost lansat?
Cum funcționează multitasking-ul în Python având în vedere GIL? În ce se deosebesc thread-urile de procese?