Как да определим дали моделът за ембединг работи добре? Какви метрики бяха използвани?
Machine Learning / AI
Можеш ли да обясниш разликата между cross-encoder и bi-encoder?
Има ли начин да се провери дали генерираният текст не съдържа фактически грешки спрямо оригинала?
Разкажи ми за квантоването на модели: какво е, защо е необходимо, какви видове има?
Как бяха извлечени данните от PDF документи за системата RAG?
Как беше избрана стратегията за чанкване (chunking) за RAG системата?
Как да тествате реализиран услуга на FastAPI?
Разкажи ми за метриките за производителност на ML услугата: латентност, RPS, как беше организирано това в твоя проект?
Разкажи ми за векторните бази данни, кои съществуват, как се различават, защо избрахте pgvector?
Разкажи ми за параметрите на генериране на LLM: температура, top-k, top-p и други.
Разкажи за най-трудната задача или трудност в един от проектите.
Как се свързват Recall и Precision, може ли да се увеличи едното, без да се намалява другото? Дайте примери за задачи.
Как да оценим качеството на обобщението?
Как бяха организирани данните за обобщаване на диалозите и как протече обучението?
Кой метод на квантизация (int8 или float) ще навреди по-малко на качеството на модела?
Как бихте подходили към задачата за обобщаване на диалог между много хора от конференция (например, 10 разработчици в Slack)?
Какъв модел и подход да изберем за обработка на аудио от конференция (speech-to-text, диаризация)?
Разкажи ми за LoRA: какво е, за какво е необходимо?
Как да работите с лични данни при локално внедряване на системата?
Защо избрахте хибридното търсене BM25 + embeddings вместо само косинусното разстояние?