Het probleem is bevestigd, wat moet er nu gebeuren?
SRE / Platform Engineer
Het incident is opgelost, de service is hersteld - is dat alles of moet er nog iets gedaan worden?
Wat is het verschil tussen Prometheus en VictoriaMetrics? Hoe heb je het scrapen vanuit meerdere clusters ingesteld?
Hoe te zien of er wijzigingen zijn geweest, wie wat heeft uitgerold?
Hoe gaat een pakket van een externe klant naar een pod in een andere namespace?
Vertel me over jezelf en je ervaring
Wat regelt de hoeveelheid pods?
Welke punten moeten er in de post-mortem zijn?
Wat is het verschil tussen Deployment, StatefulSet en DaemonSet?
Hoe heb je de monitoring voor de nieuwe service ingesteld? Hoe bewaar je dashboards?
Hoe hebt u de fouttolerantie van het Kafka-platform verzekerd?
Moet je gebruikers informeren over het incident?
Wat is het belangrijkste technische verschil tussen FluxCD en ArgoCD? Pull vs Push model?
Wat gebeurt er als je handmatig de pods van StatefulSet en DaemonSet verwijdert?
Hoe was de integratie met Vault geregeld? Hoe werden de geheimen geroteerd?
Wat zijn readiness, liveness en startup probes?
Effecten van taints: NoSchedule, PreferNoSchedule, NoExecute - wat zijn ze?
Heeft u dashboards gemaakt in Grafana? Hoe hebt u ze onderhouden?
Hoe te repareren als de service een oud geheim in het geheugen houdt?
QoS-klassen in Kubernetes: Guaranteed, Burstable, BestEffort