Как работи токенизацията? Защо се използват subword токени, а не цели думи?
Machine Learning / AI
Разкажете за BGE-M3: три представяния — гъста, рядка, много-векторна.
Какво е Recall и Precision? Задача: 50 плодове, 30 ябълки и 20 круши, роботът правилно намери 20 ябълки, но 15 круши разпознах като ябълки. Изчислете метриките.
Запознат ли сте с LoRA и методите за фина настройка?
Как бяха подбрани коефициентите за хибридното търсене?
Защо ви бяха необходими 12 000 двойки въпрос-отговор, ако имаше само 15 шаблона?
Защо разпознавахте документите като изображения, а не създадохте парсер?
Как сте формирали тестовия набор от данни: от същите 12 хиляди двойки или от нови данни?
Разкажете ни за клъстеризацията: какъв проблем решихте, какъв метод използвахте, как измервахте качеството?
Как оценихте качеството на RAG системата? Какви метрики използвахте?
Какво е плътен вектор (dense embedding)? Как се получава? Какъв е размерът му?
Как работи трансформаторът? Разкажи ми за BERT и GPT.
Какви модели бяха използвани във всеки етап? За извличане на същности, за векторизация, за генериране?
Защо е необходимо да се намали размерът на речника? Защо е лош голям речник? В коя функция се случва натоварването?
Какво е cross-encoder и къде сте го използвали?
Какво е sparse-вектор? Как се различава от dense?
Какво се изпращаше към крайните потребители във вашата система?
Каква е разликата между GET и POST заявки?
За един въпрос подходящ е един от 12 хиляди отговори или много?
Обяснете с прости думи как работи вашата система за един потребител, без асинхронност.