О слободном месту
Ищут DevOps/MLOps-инженера уровня middle/senior для администрирования и масштабирования Kubernetes-инфраструктуры с GPU-нодами, развития CI/CD и автоматизации жизненного цикла ML-моделей. Работа удалённая, только через ИП, локация — РФ.
Чем предстоит заниматься
- Администрировать и масштабировать Kubernetes-кластеры с GPU-нодами.
- Развёртывать и оптимизировать сервисы инференса vLLM и LightLLM.
- Проектировать и улучшать пайплайны GitLab CI/CD.
- Автоматизировать ручные операции и разрабатывать ботов и агентов для поддержки команды.
- Автоматизировать жизненный цикл ML-моделей: обучение, тестирование, деплой и мониторинг дрейфа данных.
- Настраивать логирование, мониторинг и алертинг на базе Prometheus, Grafana и OpenSearch.
- Администрировать серверы команды и обеспечивать отказоустойчивость и безопасность инфраструктуры.
- Участвовать в разработке, интеграции и деплое автономных агентских систем и LLM-приложений.
Условия
Работа удалённая.
Локация: РФ.
Работа только через ИП.
Будет плюсом
- Опыт поддержки и администрирования Trino, Airflow, ClickHouse, Kafka, Hadoop и Redis.
- Опыт разработки внутреннего тулинга и утилит на Python.
- Опыт оптимизации работы GPU в Kubernetes, включая device plugins, мониторинг VRAM и планирование задач.
- Знание принципов работы LLM и фреймворков для их обслуживания.