View a markdown version of this page

탐지 - 의 워크로드 재해 복구 AWS: 클라우드에서의 복구

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

탐지

워크로드가 제공해야 하는 비즈니스 성과를 제공하지 않는지 최대한 빨리 파악하는 것이 중요합니다. 이렇게 하면 재해를 신속하게 선언하고 인시던트에서 복구할 수 있습니다. 공격적인 복구 목표의 경우이 응답 시간과 적절한 정보가 결합되어 복구 목표를 달성하는 데 매우 중요합니다. 복구 시간 목표가 1시간인 경우 인시던트를 감지하고, 적절한 담당자에게 알리고, 에스컬레이션 프로세스에 참여하고, 예상 복구 시간(DR 계획을 실행하지 않고)에 대한 정보(있는 경우)를 평가하고, 재해를 선언하고, 1시간 이내에 복구해야 합니다.

참고

RTO가 위험에 처하더라도 이해관계자가 DR을 호출하지 않기로 결정한 경우 DR 계획 및 목표를 재평가합니다. DR 계획을 호출하지 않기로 한 결정은 계획이 부적절하거나 실행에 대한 신뢰도가 부족하기 때문일 수 있습니다.

비즈니스 가치를 제공하는 현실적이고 달성 가능한 목표를 제공하려면 계획 및 목표에 인시던트 감지, 알림, 에스컬레이션, 검색 및 선언을 고려하는 것이 중요합니다.

AWS는 서비스 상태 대시보드에 서비스 가용성에 대한 up-to-the-minute 정보를 게시합니다. 언제든지를 확인하여 현재 상태 정보를 가져오거나 RSS 피드를 구독하여 각 개별 서비스의 중단에 대한 알림을 받을 수 있습니다. 서비스 상태 대시보드에 표시되지 않은 서비스 중 하나에 실시간 운영 문제가 발생하는 경우 지원 요청을 생성할 수 있습니다.

는 계정에 영향을 미칠 수 있는 AWS Health 이벤트에 대한 정보를 AWS Health Dashboard 제공합니다. 이 정보는 최근 이벤트와 예정된 이벤트를 범주별로 보여 주는 대시보드 및 지난 90일간의 모든 이벤트를 보여 주는 전체 이벤트 로그의 두 가지 방법으로 표시됩니다.

가장 엄격한 RTO 요구 사항의 경우 상태 확인을 기반으로 자동 장애 조치를 구현할 수 있습니다. 사용자 경험을 대표하고 주요 성능 지표를 기반으로 상태 확인을 설계합니다. 심층 상태 확인은 워크로드의 주요 기능을 연습하고 얕은 하트비트 확인을 넘어섭니다. 여러 신호를 기반으로 심층 상태 확인을 사용합니다. 할 필요가 없을 때 장애 조치할 경우 가용성 위험이 발생하므로 거짓 경보를 트리거하지 않도록이 접근 방식에 주의하세요.