O voľnom mieste
Ищут Senior/Senior+/Lead специалиста для аудита и развития production-инфраструктуры, устранения единичных точек отказа и повышения отказоустойчивости. Работа предполагает самостоятельную реализацию технических решений и участие в расследовании production-инцидентов.
Задачи
- Провести аудит текущей production-инфраструктуры и сетевой архитектуры.
- Проанализировать причины сбоев и найти узкие места.
- Выявить и устранить единичные точки отказа.
- Разработать и реализовать план повышения доступности инфраструктуры.
- Администрировать и развивать инфраструктуру на базе Proxmox VE, включая кластеры, quorum, Corosync и Proxmox HA.
- Настраивать floating IP и VIP, а также автоматическое переключение между узлами.
- Тестировать сценарии failover и восстановления после сбоев.
- Настраивать и сопровождать сетевую инфраструктуру, маршрутизацию, NAT и firewall.
- Развивать мониторинг, централизованное логирование и систему оповещений.
- Участвовать в устранении production-инцидентов, проводить Root Cause Analysis и предотвращать повторные сбои.
- Автоматизировать инфраструктурные и эксплуатационные задачи.
- Создавать и поддерживать техническую документацию, схемы инфраструктуры и runbooks.
Условия
- Удаленная работа.
- Работа по часовому поясу Нью-Йорк, США.
- Срок выхода ASAP.
- Комфортные условия труда.
- Высокая и официальная заработная плата по итогам собеседования.
- Высококлассная техника для работы.
- Бонусы по результатам работы.
- Профессиональный и карьерный рост.
Будет преимуществом
- Опыт работы с Prometheus, Grafana, VictoriaMetrics или Zabbix.
- Опыт централизованного логирования с ELK или Loki.
- Опыт работы с Docker, Docker Compose или Docker Swarm.
- Знание Ansible или Puppet.
- Опыт создания CI/CD-пайплайнов в GitLab CI или Jenkins.
- Опыт администрирования, оптимизации и масштабирования MySQL.
- Знание Lua и опыт расширенной конфигурации OpenResty.
- Опыт построения backup- и disaster recovery-процессов.
- Опыт работы с высоконагруженными или business-critical системами.