Apie laisvą darbo vietą
Ищут автономного Senior DevOps / SRE Engineer для ответственности за стабильность и развитие production-инфраструктуры. В задачи входят миграция production на отказоустойчивый кластер, развитие мониторинга, IaC, резервного копирования и SRE-процессов.
Задачи
- Миграция production с Docker Compose в отказоустойчивый Docker Swarm или Kubernetes-кластер
- Построение мониторинга и алертинга на базе Prometheus, Grafana и Alertmanager
- Внедрение централизованного логирования
- Развитие Infrastructure as Code с использованием Ansible и Terraform
- Автоматизация резервного копирования и восстановления с целевым RTO менее одного часа
- Выстраивание on-call-процессов, runbook-документации и работы с инцидентами
- Security hardening инфраструктуры
- Внедрение SLI/SLO и подготовка к работе по SLA
Условия
- On-call 24/7: инциденты требуют быстрой реакции, включая выходные
- Автономность в принятии решений
- Ответственность за стабильность инфраструктуры