Sobes.tech
Senior

¿Qué parámetros se deben usar para evaluar la memoria en la inferencia de LLM y qué optimizaciones arquitectónicas reducen el KV-cache?