pm2-admin 관련 에러 수정

개요

  • Discord 모니터링에서 다음 두 가지 경보를 확인했다.
    • namuwiki-crawler 컨테이너 종료
    • Color-Box-Cleanup의 Vercel 보안 challenge 감지
  • 다음과 같이 해결했다.
    • namuwiki-crawler의 PostgreSQL DNS 연결 상태를 확인하고 컨테이너를 재기동했다.
    • 재부팅 후에도 자동으로 복구되도록 재시작 정책을 unless-stopped로 복원했다.
    • Vercel 보안 challenge는 실제 서비스 장애가 아니므로, 관측 제한 표시는 유지하면서 반복 Discord 알림만 제외했다.
    • Prometheus와 Alertmanager를 재적용하고 관련 경보가 모두 해제된 것을 확인했다.

배운 것

  • 컨테이너가 같은 Docker 네트워크에 연결돼 있어도, DB 컨테이너가 준비되기 전에 실행되면 호스트명 조회 실패로 종료될 수 있다.
  • 복구 과정에서 임시로 적용한 restart: "no" 설정은 모니터링의 상시 서비스 정의와 충돌할 수 있다.
  • HTTP 403 응답이 항상 애플리케이션 장애를 의미하지는 않는다. x-vercel-mitigated: challenge처럼 보안 계층에서 발생한 응답인지 구분해야 한다.
  • 알려진 보안 challenge 알림만 억제하고 실제 HTTP 장애 감시는 유지하도록 정책을 세분화하는 것이 중요하다.
  • 복구 후에는 컨테이너 상태뿐 아니라 재시작 정책, Prometheus 경보, Alertmanager 잔류 경보까지 함께 확인해야 한다.

댓글

첫 번째 댓글을 남겨보세요.