Sobes.tech
Senior

Quels paramètres doivent être utilisés pour évaluer la mémoire lors de l'inférence de LLM et quelles optimisations architecturales réduisent le cache KV?