O problema foi confirmado, o que fazer a seguir?
SRE / Platform Engineer
O incidente foi resolvido, o serviço foi restaurado - é tudo ou há mais alguma coisa a fazer?
Qual é a diferença entre Prometheus e VictoriaMetrics? Como configurou o scraping de vários clusters?
Como verificar se houve alterações, quem fez o que?
Como é que um pacote vai de um cliente externo até ao pod noutro namespace?
O que controla a quantidade de pods?
Quais pontos devem estar na análise pós-mortem?
Qual é a diferença entre Deployment, StatefulSet e DaemonSet?
Como configurou a monitorização para o novo serviço? Como guardar os painéis?
Como garantiu a tolerância a falhas da plataforma Kafka?
Fale sobre si e a sua experiência
É necessário notificar os utilizadores sobre o incidente?
Qual é a principal diferença técnica entre FluxCD e ArgoCD? Modelo Pull vs Push?
O que acontece se remover manualmente os pods do StatefulSet e do DaemonSet?
Como foi feita a integração com o Vault? Como foram rotacionados os segredos?
O que são as sondagens de readiness, liveness e startup?
Efeitos de taints: NoSchedule, PreferNoSchedule, NoExecute - o que são?
Como corrigir se o serviço mantém um segredo antigo na memória?
Classes de QoS no Kubernetes: Garantido, Burstável, Melhor Esforço
Você criou dashboards no Grafana? Como os manteve?