İlan hakkında
Команда ищет DevOps-инженера для эксплуатации и развития AI-платформы с LLM-инференсом, Kubernetes и GPU-ресурсами. В зоне ответственности — производительность, наблюдаемость, автоматизация и стабильность LLM-платформы.
Чем предстоит заниматься
- Развертывать, сопровождать и обновлять LLM-инференс платформы vLLM, SGLang и Ollama
- Эксплуатировать и развивать AI-платформу в Kubernetes, включая масштабирование и управление GPU-ресурсами
- Настраивать AI Gateway LiteLLM: маршрутизацию запросов, API-ключи, квоты, лимиты и политики доступа
- Оптимизировать производительность inference: batching, KV Cache, semantic cache, снижение latency и стоимости инференса