Проблемът беше потвърден, какво да правим след това?
SRE / Platform Engineer
Инцидентът беше решен, услугата възстановена - това ли е всичко или има още нещо, което трябва да се направи?
Каква е разликата между Prometheus и VictoriaMetrics? Как настрои събирането на данни от няколко клъстера?
Как да видите дали е имало промени, кой какво е разпространил?
Как пакетът от външен клиент достига до под в друг namespace?
Какво контролира количеството на подовете?
Разкажете ми за себе си и опита си
Каква е разликата между Deployment, StatefulSet и DaemonSet?
Какви точки трябва да бъдат в постмортема?
Как настроихте мониторинга за новата услуга? Как съхранявате таблата за управление?
Как осигурихте отказоустойчивостта на Kafka платформата?
Каква е основната техническа разлика между FluxCD и ArgoCD? Модел Pull срещу Push?
Трябва ли да уведомим потребителите за инцидента?
Какво се случва, ако ръчно изтриете подовете на StatefulSet и DaemonSet?
Как беше организирана интеграцията с Vault? Как се въртяха тайните?
Какво са readiness, liveness и startup проби?
Класове QoS в Kubernetes: Guaranteed, Burstable, BestEffort
Ефекти taints: NoSchedule, PreferNoSchedule, NoExecute - какво са те?
Създавахте ли табла в Grafana? Как ги поддържахте?
Как да поправите, ако услугата държи стар секрет в паметта?