Приведите примеры критичных инцидентов, на которые вы реагировали в течение 30 минут
SRE / Platform Engineer
Напиши команду или скрипт, который найдёт в текущем каталоге все файлы с расширением .log, содержащие слово error, и выведет только названия этих файлов.
Опиши процесс HTTP запроса к google.com по шагам (от curl до получения контента)
Нужно ли уведомлять пользователей об инциденте?
Какие способы взаимодействия между процессами ты знаешь (IPC)?
PostgreSQL с нуля приходилось разворачивать?
Какие примеры плейбуков Ansible ты делал?
Расскажи про случай из практики, когда пришлось переживать за результат?
Какие самые необычные или специфичные метрики вам приходилось выводить на дашборды?
Работал ли с Rancher?
Как устроен график внедрений: есть ли календарь и регламент или выкатки происходят вне очереди?
Как вы соотносите свой опыт с задачами позиции? Какого опыта недостаточно и что хотели бы развить?
Что такое SystemD и почему она популярна? Какие системы инициализации были раньше?
Как обеспечивал отказоустойчивость Kafka-платформы?
Для чего используется Headless Service в Kubernetes?
Вы настраивали статические или динамические маршруты на ELTEX ESR?
Как вы заходили на роутер при падении туннеля — по внешнему IP?
Какие минусы технологии лежат в основе контейнеризации?
Что такое TSDB (Time Series Database)?
Что означают права на файл 644?