Може ли доћи до условa трке у асинхроном коду Питхона?
Python
Koliko dokumenata je pronađeno tokom pretrage? Da li je bilo re-ranking?
Kako je ocenjivana kvaliteta rada RAG sistema?
Kako je funkcionisala semantička keš memorija u Redis-u?
Kako ste nadzirali rad servisa? Šta ste gledali u Grafani?
Šta još može biti optimizovano u metodi predict? (kreiranje DataFrame-a svaki put)
Zašto je bolje koristiti POST umesto GET za ovaj endpoint?
Napišite web servis na FastAPI koji prihvata POST zahtev sa podacima (prihod, starost, iznos kredita) i vraća predviđanje ML modela (odobrenje kredita)
Kako optimizovati servis da sinhrona CPU-zadatak (model predviđanja) ne blokira event loop FastAPI?
Ispričaj mi cijeli pipeline RAG sustava: koje su dokumente koristili, kako su ih učitavali i obrađivali?
Šta je Singleton i kako ga primeniti za učitavanje modela? Koje su mane Singleton-u?
Koliko je vremena trajao cijeli RAG pipeline od zahteva do odgovora?
Kako su dokumenti učitani u vektorsku bazu podataka? Kako je tekao chunking?
Koji problem nastaje i kako ga rešiti ako u asinhronoj usluzi koristi lokalni ML model (npr. reranker) koji se poziva sinhrono?
Kako su dobijeni embed-ovi? Kroz koji model i kako je pokrenut?
Kako funkcioniše višestruko pokretanje u Pythonu uzimajući u obzir GIL? Čime se niti razlikuju od procesa?