Le problème a été confirmé, que faire ensuite?
SRE / Platform Engineer
L'incident a été résolu, le service restauré - est-ce tout ou faut-il faire autre chose?
Quelle est la différence entre Prometheus et VictoriaMetrics ? Comment avez-vous configuré le scraping depuis plusieurs clusters ?
Comment voir s'il y a eu des changements, qui a déployé quoi?
Comment un paquet voyage-t-il d'un client externe à un pod dans un autre namespace?
Qu'est-ce qui contrôle la quantité de pods?
Quels points doivent être abordés lors du post-mortem?
Quelle est la différence entre Deployment, StatefulSet et DaemonSet?
Comment avez-vous assuré la tolérance aux pannes de la plateforme Kafka?
Comment avez-vous configuré la surveillance pour le nouveau service ? Comment stocker les tableaux de bord ?
Parlez-moi de vous et de votre expérience
Quelle est la différence technique fondamentale entre FluxCD et ArgoCD ? Modèle Pull vs Push ?
Faut-il informer les utilisateurs de l'incident?
Que se passe-t-il si vous supprimez manuellement les pods de StatefulSet et DaemonSet ?
Comment l'intégration avec Vault a-t-elle été organisée ? Comment les secrets ont-ils été rotés ?
Quelles sont les vérifications de readiness, liveness et startup ?
Classes de QoS dans Kubernetes : Garantie, Burst, Meilleur Effort
Comment réparer si le service garde un ancien secret en mémoire?
Avez-vous créé des tableaux de bord dans Grafana ? Comment les entreteniez-vous ?
Qu'est-ce que PodDisruptionBudget ?