Problém bol potvrdený, čo robiť ďalej?
SRE / Platform Engineer
Incident bol vyriešený, služba obnovená - je to všetko alebo je ešte niečo, čo treba urobiť?
Aký je rozdiel medzi Prometheus a VictoriaMetrics? Ako si nakonfiguroval scraping z viacerých klastrov?
Ako vidieť, či boli nejaké zmeny, kto čo nasadil?
Ako sa paket dostane od externého klienta k podu v inom namespace?
Čo riadi počet podov?
Povedzte mi o sebe a svojich skúsenostiach
Aké body by mali byť v post-mortem?
Aký je rozdiel medzi Deployment, StatefulSet a DaemonSet?
Ako ste nastavili sledovanie pre novú službu? Ako uchovávate dashboardy?
Ako ste zabezpečili odolnosť platformy Kafka voči chybám?
Aký je hlavný technický rozdiel medzi FluxCD a ArgoCD? Model Pull vs Push?
Je potrebné informovať používateľov o incidente?
Čo sa stane, ak manuálne odstránite pody StatefulSet a DaemonSet?
Ako bola organizovaná integrácia s Vault? Ako sa rotovali tajomstvá?
Čo sú readiness, liveness a startup skúšky?
Triedy QoS v Kubernetes: Guaranteed, Burstable, BestEffort
Účinky taints: NoSchedule, PreferNoSchedule, NoExecute - čo sú to?
Ako opraviť, ak služba drží staré tajomstvo v pamäti?
Čo je PodDisruptionBudget?