View a markdown version of this page

Rilevamento - Disaster recovery dei carichi di lavoro su AWS: Recovery nel cloud

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Rilevamento

È importante sapere il prima possibile che i carichi di lavoro non forniscono i risultati aziendali che avrebbero dovuto fornire. In questo modo, è possibile dichiarare rapidamente un disastro e riprendersi da un incidente. Per obiettivi di ripristino aggressivi, questo tempo di risposta abbinato a informazioni appropriate è fondamentale per raggiungere gli obiettivi di ripristino. Se l'obiettivo del tempo di ripristino è di un'ora, è necessario rilevare l'incidente, informare il personale appropriato, avviare i processi di escalation, valutare le informazioni (se disponibili) sui tempi previsti per il ripristino (senza eseguire il piano di disaster recovery), dichiarare un problema e ripristinare il sistema entro un'ora.

Nota

Se le parti interessate decidono di non ricorrere al DR anche se l'RTO sarebbe a rischio, rivalutate i piani e gli obiettivi del DR. La decisione di non invocare i piani di DR può essere dovuta al fatto che i piani sono inadeguati o alla mancanza di fiducia nell'esecuzione.

Nella pianificazione e negli obiettivi è fondamentale tenere conto del rilevamento, della notifica, dell'escalation, dell'individuazione e della dichiarazione degli incidenti per fornire obiettivi realistici e raggiungibili che offrano valore aziendale.

AWS pubblica la maggior parte delle up-to-the-minute informazioni sulla disponibilità dei servizi nel Service Health Dashboard. Controlla in qualsiasi momento per ottenere informazioni aggiornate sullo stato o iscriviti a un feed RSS per ricevere notifiche sulle interruzioni di ogni singolo servizio. Se riscontri un problema operativo in tempo reale con uno dei nostri servizi che non viene visualizzato nella Service Health Dashboard, puoi creare una Support Request.

Dashboard AWS HealthFornisce informazioni sugli AWS Health eventi che possono influire sul tuo account. Le informazioni vengono presentate in due modi: un pannello di controllo che mostra eventi recenti e prossimi organizzati per categoria e un registro completo che mostra tutti gli eventi degli ultimi 90 giorni.

Per soddisfare i requisiti RTO più rigorosi, è possibile implementare il failover automatico basato su controlli di integrità. Progetta controlli di integrità rappresentativi dell'esperienza utente e basati su indicatori chiave di prestazione. I controlli approfonditi dello stato di salute esercitano le funzionalità chiave del carico di lavoro e vanno oltre i controlli superficiali del battito cardiaco. Utilizza controlli sanitari approfonditi basati su più segnali. Utilizzate questo approccio con cautela per non attivare falsi allarmi, poiché il failover quando non è necessario può di per sé comportare rischi di disponibilità.