Il problema è stato confermato, cosa fare dopo?
SRE / Platform Engineer
L'incidente è stato risolto, il servizio ripristinato - è tutto o c'è qualcos'altro da fare?
Qual è la differenza tra Prometheus e VictoriaMetrics? Come hai configurato lo scraping da più cluster?
Come verificare se ci sono state modifiche, chi ha distribuito cosa?
Come viaggia un pacchetto da un client esterno a un pod in un altro namespace?
Cosa controlla la quantità di pod?
Quali punti devono essere presenti nel post-mortem?
Qual è la differenza tra Deployment, StatefulSet e DaemonSet?
Come hai garantito la tolleranza ai guasti della piattaforma Kafka?
Come hai configurato il monitoraggio per il nuovo servizio? Come conservare i dashboard?
È necessario informare gli utenti dell'incidente?
Qual è la differenza tecnica fondamentale tra FluxCD e ArgoCD? Modello Pull vs Push?
Parlami di te e della tua esperienza
Cosa succede se si eliminano manualmente i pod di StatefulSet e DaemonSet?
Come è stata organizzata l'integrazione con Vault? Come sono stati ruotati i segreti?
Cosa sono i test di readiness, liveness e startup?
Come riparare se il servizio tiene un vecchio segreto in memoria?
Hai creato dashboard in Grafana? Come li hai mantenuti?
Cos'è PodDisruptionBudget?
Effetti dei taints: NoSchedule, PreferNoSchedule, NoExecute - cosa sono?