Über die Stelle
Специалист будет проектировать и поддерживать инфраструктуру для AI-систем: от обучения и валидации моделей до их деплоя и мониторинга в production. В зоне ответственности — GPU-кластеры, ML-пайплайны, inference-серверы, автоматизация и соблюдение требований информационной безопасности.
Вам предстоит
- Проектировать архитектуру AI-систем от прототипа до production
- Внедрять GPU-планировщик Kueue, Volcano или аналог для шаринга нагрузки на одном оборудовании
- Проектировать и поддерживать ML-пайплайны для обучения, валидации и деплоя моделей
- Настраивать CI/CD для моделей, включая версионирование данных, моделей и экспериментов
- Настраивать мониторинг production-моделей, включая drift detection и performance tracking
- Деплоить и оптимизировать LLM и inference-серверы vLLM, TGI и Triton
- Контейнеризировать и оркестрировать сервисы с использованием Docker и Kubernetes
- Настраивать CI/CD с использованием GitLab CI и Jenkins
- Использовать Terraform и Ansible для IaC
- Настраивать мониторинг и observability с использованием Prometheus и Grafana
- Автоматизировать рутинные операции
- Обеспечивать выполнение требований ИБ в отношении инфраструктуры
- Вести техническую документацию по вверенным ресурсам
Ожидания
- Бэкграунд в ML/DS и понимание процессов обучения, инференса и работы с данными
- Опыт от 2 лет в MLOps или DevOps с ML-спецификой будет огромным плюсом
- Production-опыт работы с Docker и Kubernetes, включая Helm и управление кластерами
- Уверенное владение Python
- Знание CI/CD, включая GitLab CI, Jenkins и методологию GitOps
- Глубокие знания Linux
Условия
- Локация: Москва
- Формат работы: офис
- Зарплата обсуждается на собеседовании