Problēma tika apstiprināta, ko dar darīt?
SRE / Platform Engineer
Incidents tika atrisināts, pakalpojums tika atjaunots - vai tas ir viss vai vēl kaut kas jādara?
Kāda ir atšķirība starp Prometheus un VictoriaMetrics? Kā jūs konfigurējāt scrape no vairākiem klasteriem?
Kā redzēt, vai bija kādas izmaiņas, kas ko izvietoja?
Kā pakete no ārēja klienta nonāk pie poda citā namespace?
Kas kontrolē podu skaitu?
Kādi punkti jāiekļauj post-mortemā?
Kāda ir atšķirība starp Deployment, StatefulSet un DaemonSet?
Kā iestatījāt uzraudzību jaunajam pakalpojumam? Kā glabāt paneles?
Kā nodrošinājāt Kafka platformas kļūdu tolerance?
Kāda ir galvenā tehniskā atšķirība starp FluxCD un ArgoCD? Pull vs Push modelis?
Vai ir nepieciešams paziņot lietotājiem par incidentu?
Pastāstiet man par sevi un savu pieredzi
Kas notiek, ja manuāli dzēsiet StatefulSet un DaemonSet podus?
Kā tika organizēta integrācija ar Vault? Kā tika rotēti noslēpumi?
Kas ir readiness, liveness un startup pārbaudes?
Kā labot, ja pakalpojums glabā vecu noslēpumu atmiņā?
Vai jūs izveidojāt dashboards Grafana? Kā jūs tos uzturējāt?
Kas ir PodDisruptionBudget?
Taints efekti: NoSchedule, PreferNoSchedule, NoExecute - kas tas ir?