Das Problem wurde bestätigt, was ist als Nächstes zu tun?
SRE / Platform Engineer
Der Vorfall wurde gelöst, der Dienst wiederhergestellt - ist das alles oder muss noch etwas getan werden?
Was ist der Unterschied zwischen Prometheus und VictoriaMetrics? Wie hast du das Scraping aus mehreren Clustern eingerichtet?
Wie kann man sehen, ob Änderungen vorgenommen wurden, wer was ausgerollt hat?
Wie gelangt ein Paket vom externen Client zum Pod in einem anderen Namespace?
Was steuert die Anzahl der Pods?
Welche Punkte sollten in der Nachbesprechung enthalten sein?
Was ist der Unterschied zwischen Deployment, StatefulSet und DaemonSet?
Wie haben Sie die Fehlertoleranz der Kafka-Plattform gewährleistet?
Wie hast du das Monitoring für den neuen Service eingerichtet? Wie speichert man Dashboards?
Erzählen Sie mir von sich und Ihrer Erfahrung
Was ist der grundlegende technische Unterschied zwischen FluxCD und ArgoCD? Pull- vs Push-Modell?
Muss man die Nutzer über den Vorfall informieren?
Was passiert, wenn man die Pods von StatefulSet und DaemonSet manuell löscht?
Wie war die Integration mit Vault aufgebaut? Wie wurden die Geheimnisse rotiert?
Was sind Readiness-, Liveness- und Startup-Tests?
QoS-Klassen in Kubernetes: Guaranteed, Burstable, BestEffort
Wie repariert man, wenn der Dienst ein altes Geheimnis im Speicher behält?
Haben Sie Dashboards in Grafana erstellt? Wie haben Sie sie gepflegt?
Was ist PodDisruptionBudget?