Sobes.tech
Senior

Jakie parametry należy użyć do oceny pamięci dla inferencji LLM i jakie optymalizacje architektoniczne zmniejszają KV-cache?