Sobes.tech
Senior

Quais parâmetros devem ser usados para avaliar a memória na inferência de LLM e que otimizações arquitetónicas reduzem o KV-cache?