Sobes.tech
Middle+

Estás solo en turno por la noche, NGINX Ingress se cae, 20 servicios no están disponibles. Describe las acciones con comandos.

sobes.tech AI

Respuesta de la IA

Если ночью падает NGINX Ingress и 20 сервисов становятся недоступны, нужно быстро локализовать и устранить проблему.

  1. Проверить состояние Ingress контроллера:
kubectl get pods -n ingress-nginx
kubectl describe pod <ingress-pod> -n ingress-nginx
kubectl logs <ingress-pod> -n ingress-nginx
  1. Проверить события в namespace:
kubectl get events -n ingress-nginx --sort-by=.metadata.creationTimestamp
  1. Проверить состояние сервисов и эндпоинтов:
kubectl get svc
kubectl get endpoints
  1. Проверить состояние нод и сетевых компонентов:
kubectl get nodes
kubectl describe node <node-name>
  1. Если Ingress контроллер упал, попытаться перезапустить:
kubectl delete pod <ingress-pod> -n ingress-nginx
  1. Проверить конфигурацию Ingress ресурсов на ошибки:
kubectl get ingress
kubectl describe ingress <ingress-name>
  1. Если проблема в конфигурации, исправить и применить заново:
kubectl apply -f ingress.yaml
  1. Проверить логи приложений, если подозрение на downstream:
kubectl logs <pod> -n <namespace>
  1. Если проблема критична и не решается быстро, переключить трафик на резервный Ingress или использовать обходные пути.

  2. После восстановления провести анализ причин и оформить инцидент.

Важно сохранять спокойствие, фиксировать все действия и использовать мониторинг и алерты для ускорения диагностики.