A probléma megerősítést nyert, mit tegyünk ezután?
SRE / Platform Engineer
A incidens megoldódott, a szolgáltatás helyreállt - ez minden vagy még van mit tenni?
Mi a különbség a Prometheus és a VictoriaMetrics között? Hogyan állítottad be a scrapinget több klaszterről?
Hogyan nézheted meg, voltak-e változások, ki mit telepített?
Hogyan jut el egy csomag egy külső kliensről egy másik namespace-ben lévő podhoz?
Mi szabályozza a podok számát?
Milyen pontoknak kell szerepelniük a post-mortemben?
Mi a különbség a Deployment, StatefulSet és DaemonSet között?
Hogyan állítottad be a monitoringot az új szolgáltatáshoz? Hogyan tárolod a műszerfalakat?
Hogyan biztosította a Kafka platforma hibatűrését?
Mi a fő technikai különbség a FluxCD és az ArgoCD között? Pull vs Push modell?
Szükséges-e értesíteni a felhasználókat az esetről?
Meséljen magáról és a tapasztalatáról
Mi történik, ha manuálisan törlöd a StatefulSet és DaemonSet podokat?
Hogyan volt szervezve a Vault-tal való integráció? Hogyan rotálták a titkokat?
Mi az a readiness, liveness és startup próbák?
Hogyan javítható ki, ha a szolgáltatás egy régi titkot tart a memóriában?
Te készítettél dashboardokat a Grafanában? Hogyan tartottad őket karban?
Mi az a PodDisruptionBudget?
A taintok hatásai: NoSchedule, PreferNoSchedule, NoExecute - mik ezek?