Problema buvo patvirtinta, ką daryti toliau?
SRE / Platform Engineer
Įvykis išspręstas, paslauga atstatyta - ar tai viskas ar dar ką nors reikia padaryti?
Kuo skiriasi Prometheus ir VictoriaMetrics? Kaip nustatėte scrape iš kelių klasterių?
Kaip pamatyti, ar buvo kokių nors pakeitimų, kas ką įdiegė?
Kaip paketas keliauja iš išorinio kliento iki kito namespace'o podo?
Kas kontroliuoja podų kiekį?
Kokie punktai turėtų būti po mirties?
Kuo skiriasi Deployment, StatefulSet ir DaemonSet?
Papaskinkite apie save ir savo patirtį
Kaip nustatėte stebėseną naujame serveryje? Kaip saugoti dashboard'us?
Kaip užtikrinote Kafka platformos atsparumą gedimams?
Kokia yra pagrindinė techninė skirtumas tarp FluxCD ir ArgoCD? Pull vs Push modelis?
Ar būtina pranešti vartotojams apie incidentą?
Kas nutiks, jei rankiniu būdu ištrinsite StatefulSet ir DaemonSet podus?
Kaip buvo organizuota integracija su Vault? Kaip rotuotos paslaptys?
Kas yra readiness, liveness ir startup testai?
QoS klasės Kubernetes: Guaranteed, Burstable, BestEffort
Taints poveikiai: NoSchedule, PreferNoSchedule, NoExecute - kas tai?
Kaip pataisyti, jei paslauga laiko seną paslaptį atmintyje?
Ar kūrėte dashboards Grafana? Kaip juos palaikėte?