View a markdown version of this page

Detección - Recuperación de cargas de trabajo ante desastres en AWS: recuperación en la nube

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Detección

Es importante saber lo antes posible que sus cargas de trabajo no están produciendo los resultados empresariales que deberían ofrecer. De esta forma, puede declarar rápidamente un desastre y recuperarse de un incidente. Para los objetivos de recuperación exigentes, este tiempo de respuesta, junto con la información adecuada, es fundamental para cumplir los objetivos de recuperación. Si su objetivo de tiempo de recuperación es de una hora, debe detectar el incidente, notificar al personal correspondiente, iniciar los procesos de escalamiento, evaluar la información (si la tiene) sobre el tiempo previsto de recuperación (sin ejecutar el plan de recuperación ante desastres), declarar un desastre y recuperarse en una hora.

nota

Si las partes interesadas deciden no recurrir a la DR a pesar de que la RTO estaría en peligro, reevalúe los planes y objetivos de la DR. La decisión de no invocar los planes de DR puede deberse a que los planes son inadecuados o a una falta de confianza en la ejecución.

Es fundamental tener en cuenta la detección, la notificación, la escalación, el descubrimiento y la declaración de incidentes en la planificación y los objetivos para ofrecer objetivos realistas y alcanzables que aporten valor empresarial.

AWS publica la mayor parte de la up-to-the-minute información sobre la disponibilidad de los servicios en el Service Health Dashboard. Compruebe en cualquier momento si desea obtener información sobre el estado actual o suscríbase a una fuente RSS para recibir notificaciones sobre las interrupciones de cada servicio individual. Si tiene un problema operativo en tiempo real con uno de nuestros servicios que no aparece en el Service Health Dashboard, puede crear una solicitud de soporte.

Panel de AWS HealthProporciona información sobre AWS Health los eventos que pueden afectar a su cuenta. La información se presenta de dos formas: en un panel donde se muestran los eventos recientes y próximos organizados por categorías, y en un log de eventos que contiene todos los eventos de los últimos 90 días.

Para cumplir con los requisitos de RTO más estrictos, puede implementar una conmutación por error automatizada basada en controles de estado. Diseñe controles de estado que sean representativos de la experiencia del usuario y se basen en los indicadores clave de rendimiento. Los controles de estado exhaustivos ejercitan las funciones clave de su carga de trabajo y van más allá de los controles superficiales de los latidos del corazón. Utilice controles de estado exhaustivos basados en múltiples señales. Tenga cuidado con este enfoque para no activar falsas alarmas, ya que una conmutación por error cuando no es necesaria puede por sí sola introducir riesgos de disponibilidad.