Může dojít k race condition v asynchronním kódu Pythonu?
Python
Kolik dokumentů bylo při hledání získáno? Došlo k re-rankingu?
Jak byla hodnocena kvalita práce systému RAG?
Jak fungoval semantický cache v Redis?
Jak jste sledovali chod služby? Co jste sledovali v Grafaně?
Co lze ještě optimalizovat v metodě predict? (vytváření DataFrame pokaždé)
Proč je lepší používat POST místo GET pro tento endpoint?
Napište webovou službu na FastAPI, která přijímá POST žádost s údaji (příjmy, věk, výše úvěru) a vrací předpověď ML modelu (schválení úvěru)
Jak optimalizovat službu, aby synchronní CPU úkol (předpovědní model) nezablokoval event loop FastAPI?
Pověz mi celý pipeline systému RAG: jaké dokumenty byly použity, jak byly načteny a zpracovány?
Co je Singleton a jak jej použít pro načítání modelu? Jaké jsou nevýhody Singletonu?
Jak dlouho trval celý RAG pipeline od požadavku po odpověď?
Jaký problém nastává a jak ho řešit, pokud v asynchronní službě používáte místní ML model (například reranker), který je volán synchronně?
Jak byly dokumenty načítány do vektorové databáze? Jak probíhal chunking?
Jak byly získány embedde? Přes jaký model a jak byl spuštěn?
Jak funguje vícenásobné vlákno v Pythonu s ohledem na GIL? Čím se vlákna liší od procesů?