Sobes.tech
Senior

По каким параметрам оценить память для инференса LLM и какие архитектурные оптимизации уменьшают KV-cache?