Sobes.tech
Senior

Кои параметри трябва да се използват за оценка на паметта за inference на LLM и кои архитектурни оптимизации намаляват KV-кеша?