Problema a fost confirmată, ce trebuie să facem în continuare?
SRE / Platform Engineer
Incidentul a fost rezolvat, serviciul a fost restaurat - este tot sau mai trebuie făcut ceva?
Care este diferența dintre Prometheus și VictoriaMetrics? Cum ai configurat colectarea de date din mai multe clustere?
Cum să vezi dacă au fost modificări, cine a implementat ce?
Cum ajunge un pachet de la un client extern la un pod într-un alt namespace?
Ce controlează cantitatea de pods?
Ce puncte trebuie să fie în post-mortem?
Care este diferența dintre Deployment, StatefulSet și DaemonSet?
Cum ai configurat monitorizarea pentru noul serviciu? Cum păstrezi panourile de bord?
Cum ați asigurat reziliența platformei Kafka?
Spuneți-mi despre dvs. și experiența dvs.
Este necesar să notifici utilizatorii despre incident?
Care este diferența tehnică principală între FluxCD și ArgoCD? Modelul Pull vs Push?
Ce se întâmplă dacă ștergeți manual pod-urile StatefulSet și DaemonSet?
Cum a fost organizată integrarea cu Vault? Cum au fost rotite secretele?
Ce sunt probele de readiness, liveness și startup?
Efectele taints: NoSchedule, PreferNoSchedule, NoExecute - ce sunt acestea?
Cum să repari dacă serviciul păstrează un secret vechi în memorie?
Clasele QoS în Kubernetes: Garantat, Burstable, BestEffort
Ai creat dashboard-uri în Grafana? Cum le-ai întreținut?