View a markdown version of this page

偵測 - 上工作負載的災難復原 AWS:雲端中的復原

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

偵測

請務必盡快知道您的工作負載未提供應交付的業務成果。透過這種方式,您可以快速宣告災難並從事件中復原。對於積極的復原目標,此回應時間結合適當的資訊對於實現復原目標至關重要。如果您的復原時間目標是一小時,則您需要偵測事件、通知適當的人員、參與呈報程序、評估預期的復原時間資訊 (如果有的話) (不執行 DR 計畫)、宣告災難並在一小時內復原。

注意

如果利益相關者決定不叫用 DR,即使 RTO 存在風險,則重新評估 DR 計劃和目標。不調用 DR 計劃的決定可能是因為計劃不足或對執行缺乏信心。

將事件偵測、通知、呈報、探索和宣告納入您的規劃和目標中至關重要,以提供提供商業價值的實際、可實現的目標。

AWS 會在服務運作狀態儀表板上發佈有關服務可用性up-to-the-minute。隨時檢查以取得目前的狀態資訊,或訂閱 RSS 摘要,以便在每個個別服務中斷時收到通知。如果您遇到我們其中一個服務未顯示在服務運作狀態儀表板上的即時操作問題,您可以建立支援請求

AWS Health 儀板表 提供有關可能影響您的帳戶 AWS Health 之事件的資訊。資訊以兩種方式呈現:儀表板 (依類別顯示最近和近期事件) 和完整的事件日誌 (顯示過去 90 天內的所有事件)。

如需最嚴格的 RTO 需求,您可以根據運作狀態檢查實作自動容錯移轉。根據關鍵效能指標,設計代表使用者體驗的運作狀態檢查。深度運作狀態檢查會執行工作負載的關鍵功能,並超越淺活動訊號檢查。根據多個訊號使用深層運作狀態檢查。使用此方法時請小心,以免觸發錯誤警示,因為在本身不需要 時容錯移轉會帶來可用性風險。