O pozícii
Команда ищет DevOps-специалиста для эксплуатации и развития AI-платформы с LLM-инференсом, Kubernetes и GPU-ресурсами.
Чем предстоит заниматься
- Развертывать, сопровождать и обновлять LLM-инференс-платформы на базе vLLM, SGLang и Ollama
- Эксплуатировать и развивать AI-платформу в Kubernetes, включая масштабирование и управление GPU-ресурсами
- Настраивать AI Gateway на базе LiteLLM: маршрутизацию запросов, API-ключи, квоты, лимиты и политики доступа
- Оптимизировать производительность inference: batching, KV Cache, semantic cache, снижение latency и стоимости инференса