Може ли да възникне състезателна ситуация в асинхронния код на Python?
Python
Колко документа бяха извлечени при търсенето? Имаше ли re-ranking?
Как работеше семантичният кеш в Redis?
Как беше оценено качеството на работата на RAG системата?
Как наблюдавахте работата на услугата? Какво гледахте в Grafana?
Какво още може да се оптимизира в метода predict? (създаване на DataFrame всеки път)
Защо е по-добре да използвате POST вместо GET за този крайна точка?
Напишете уеб услуга на FastAPI, която приема POST заявка с данни (доход, възраст, размер на кредита) и връща предсказание на ML модела (одобрение на кредита)
Как да оптимизираме услугата, така че синхронната CPU задача (модел за прогнозиране) да не блокира event loop-а на FastAPI?
Разкажи ми цялата верига на RAG системата: кои документи са използвани, как са били заредени и обработени?
Какво е Singleton и как да го приложим за зареждане на модел? Какви са недостатъците на Singleton?
Колко време отне цялата RAG тръбна линия от заявката до отговора?
Как бяха заредени документите във векторната база данни? Как протече чанкингът?
Какъв проблем възниква и как да го решим, ако в асинхронна услуга се използва локален ML модел (например reranker), който се извиква синхронно?
Как бяха получени ембедингите? Чрез коя модел и как беше стартирана?
Как работи многопоточността в Python с оглед на GIL? Как се различават нишките от процесите?