Problém byl potvrzen, co dělat dál?
SRE / Platform Engineer
Incident byl vyřešen, služba obnovena - je to všechno nebo je třeba ještě něco udělat?
Jaký je rozdíl mezi Prometheus a VictoriaMetrics? Jak jsi nakonfiguroval scraping z více clusterů?
Jak zjistit, zda došlo ke změnám, kdo co nasadil?
Jak se paket dostane od externího klienta k podu v jiném namespace?
Co řídí počet podů?
Jaké body by měly být v post-mortem?
Jaký je rozdíl mezi Deployment, StatefulSet a DaemonSet?
Jak jste nastavili monitoring pro novou službu? Jak ukládat dashboardy?
Jak jste zajistili odolnost platformy Kafka vůči chybám?
Povězte mi o sobě a svých zkušenostech
Je třeba informovat uživatele o incidentu?
Jaký je zásadní technický rozdíl mezi FluxCD a ArgoCD? Model Pull vs Push?
Co se stane, když ručně odstraníte pody StatefulSet a DaemonSet?
Jak byla organizována integrace s Vault? Jak byly rotovány tajemství?
Co jsou to zkoušky readiness, liveness a startup?
Efekty taints: NoSchedule, PreferNoSchedule, NoExecute - co to je?
Jak opravit, pokud služba drží staré tajemství v paměti?
Třídy QoS v Kubernetes: Guaranteed, Burstable, BestEffort
Vytvářel jste dashboardy v Grafaně? Jak jste je udržoval?