Problem został potwierdzony, co dalej?
SRE / Platform Engineer
Incydent został rozwiązany, usługa przywrócona - to wszystko, czy jeszcze coś trzeba zrobić?
Jaka jest różnica między Prometheus a VictoriaMetrics? Jak skonfigurowałeś scrape z wielu klastrów?
Jak sprawdzić, czy były jakieś zmiany, kto co wdrożył?
Jak pakiet podróżuje od zewnętrznego klienta do poda w innym namespace?
Opowiedz mi o sobie i swoim doświadczeniu
Co kontroluje ilość podów?
Jakie punkty powinny być w post-mortem?
Jaka jest różnica między Deployment, StatefulSet a DaemonSet?
Jak skonfigurowałeś monitorowanie nowej usługi? Jak przechowywać pulpity nawigacyjne?
Jak zapewniłeś odporność na awarie platformy Kafka?
Czy należy powiadomić użytkowników o incydencie?
Jaka jest zasadnicza różnica techniczna między FluxCD a ArgoCD? Model Pull vs Push?
Co się dzieje, jeśli ręcznie usuniemy pody StatefulSet i DaemonSet?
Jak wyglądała integracja z Vault? Jak rotowano sekrety?
Czym są testy readiness, liveness i startup?
Efekty taintów: NoSchedule, PreferNoSchedule, NoExecute - co to jest?
Klasy QoS w Kubernetes: Gwarantowane, Burstowe, Najlepsze wysiłki
Czy tworzyłeś pulpity w Grafana? Jak je utrzymywałeś?
Jak naprawić, jeśli usługa trzyma stare sekret w pamięci?