View a markdown version of this page

Desarrolle manuales y planes de respuesta para responder a un incidente en Detección y respuesta a incidentes - Guía del usuario de detección y respuesta a incidentes de AWS

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Desarrolle manuales y planes de respuesta para responder a un incidente en Detección y respuesta a incidentes

La detección y respuesta a incidentes de AWS utiliza la información recopilada durante la incorporación de las cargas de trabajo para desarrollar manuales de ejecución destinados a la gestión de los incidentes que afectan a sus cargas de trabajo. Los manuales documentan las medidas que toman los administradores de incidentes para responder a un incidente. Un plan de respuesta se asigna al menos a una de sus cargas de trabajo. El equipo de gestión de incidentes crea estas plantillas a partir de la información que proporcionaste durante la incorporación de las cargas de trabajo.

Resultados clave:

  • Finalización de la definición de la carga de trabajo sobre la detección y respuesta a incidentes de AWS.

  • Finalización de las alarmas y los manuales de ejecución sobre la detección y respuesta a incidentes de AWS.

También puede descargar un ejemplo del manual de detección y respuesta a incidentes de AWS: aws-idr-runbook-example.zip.

ejemplo Ejemplo de libro de ejercicios
Description (Descripción)

Este documento está destinado a [CustomerName] - [WorkloadName].

Paso: Prioridad

Acciones prioritarias

  1. Envía la primera correspondencia sobre el Soporte caso al cliente como se indica a continuación.

Hello, This is <<Engineer's name>> from AWS Incident Detection and Response. An alarm has triggered for your workload <<Application_Name>>. I am currently investigating and will update you in a few minutes once I have finished initial investigation. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier>
Paso: Información

Planes de compromiso

Esta sección describe los planes de participación aplicables a este manual y solo contiene los datos de contacto. Se hará referencia a los planes de participación en los planes de comunicación paso a paso.

  • Compromiso inicial

    El equipo de detección y respuesta a incidentes de AWS añade al Soporte caso las direcciones de las partes interesadas de los clientes que figuran a continuación. AWS las partes interesadas se dirigen a otras partes interesadas que podrían necesitar estar al tanto de cualquier problema.

    • Partes interesadas del cliente: correo electrónico del cliente 1; correo electrónico del cliente 2; dispositivo móvil 1

    • AWS Partes interesadas: aws-idr-oncall@amazon.com; correo electrónico del equipo del equipo; etc.

    • Contactos únicos: [Son contactos de correo electrónico que solo se incluyen en la primera comunicación. Elimine estos contactos una vez finalizada la primera comunicación. Pueden ser direcciones de correo electrónico de clientes que buscan, como buscapersonas, que no deben buscarse para cada correspondencia. Agregue instrucciones explícitas en la sección «Prioridad», «Planes de comunicación», sobre cómo utilizarlos solo si está disponible la opción de contactos únicos.]

  • Configuración de llamadas en caso de incidente

    Indique si el cliente necesita AWS Incident Detection and Response para crear un puente, si utiliza un puente estático o si proporcionará un puente cuando se produzca un incidente.

    (Elija una opción según las preferencias del cliente)

    • La detección y respuesta a incidentes de AWS crean un Amazon Chime/Zoom Bridge

    • El puente estático proporcionado por el cliente

      • Número de conferencia: < Insert Conference number >

    • El cliente proporciona información sobre el puente de cada incidente respondiendo a la comunicación enviada por el equipo de detección y respuesta a incidentes de AWS.

    • Otros: especifique los detalles.

  • Escalación de la participación

    AWS Incident Detection and Response contactará con los siguientes contactos cuando los contactos del plan de participación inicial no respondan a los incidentes.

    Para cada contacto de escalamiento, indique si debe agregarlo al Soporte caso, llamarlo por teléfono o ambos.

    • Asegúrese de haber llamado al contacto de Initial Engagement, si corresponde, antes de iniciar la escalada.

    • Contacto de primer escalamiento: [escalamiento EmailAddress #1]/[PhoneNumber] - Espere XX minutos antes de pasar a este contacto.

      • [Añadir contacto al caso/teléfono] este contacto.

    • Segundo contacto escalador: [escalamiento EmailAddress #2]/[PhoneNumber] - Espera XX minutos antes de pasar a este contacto.

      • [Agregar contacto al caso/teléfono] este contacto.

    • etc.

Planes de comunicación

En esta sección se describe cómo los ingenieros de gestión de incidentes se comunican con las partes interesadas designadas fuera de los canales de llamada y comunicación relacionados con los incidentes.

  • Plan de comunicación de impacto

    Este plan se inicia cuando AWS Incident Detection and Response determina, a partir de una clasificación por etapas, que una alerta indica un posible impacto para un cliente.

    AWS Incident Detection and Response solicitará al cliente que se una al puente predeterminado, tal y como se indica en Planes de compromiso: configuración de llamadas ante incidentes.

    (Elija uno en función de si los contactos únicos están disponibles o no).

    1. Asegúrese de que las partes interesadas del cliente de los planes de participación: la participación inicial se agreguen al caso CC.

    OR

    1. Asegúrese de que las partes interesadas del cliente y los contactos únicos de los planes de interacción: la participación inicial se agreguen al caso CC.

    2. Envía la notificación de interacción al cliente según la siguiente plantilla:

      (Elige una)

      Plantilla de impacto: Amazon Chime Bridge

      The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Amazon Chime Bridge below so we can start the steps outlined in your Runbook: Amazon Chime Meeting ID: <insert_Meeting_ID_here> Link to Amazon Chime Bridge: <insert_Link_here> International dial-in numbers: https://chime.aws/dialinnumbers/

      Plantilla de impacto: puente proporcionado por el cliente

      The following alarm has engaged AWS Incident Detection and Response: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025 3:30 PM UTC> Please respond with your internal bridge details so we can join and start the steps outlined in your Runbook.

      Plantilla de impacto: Customer Static Bridge

      The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert CloudWatch Alarm ARN or APM Response Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Bridge below so we can start the steps outlined in your Runbook: Conference Number: <insert_conference_number> Conference URL: <insert_bridge_URL>
    3. Defina el caso como pendiente de acción del cliente.

    4. Elimine del caso los contactos que solo hayan sido enviados una sola vez después de enviar la comunicación de impacto mencionada anteriormente. (Si está disponible la opción Contactos únicos).

    5. Siga el plan de escalamiento de la participación mencionado anteriormente.

    6. Si el cliente no responde en 30 minutos, desconéctese y continúe monitoreando hasta que se recupere la alarma.

  • Sin plan de comunicación de impacto

    Este plan se inicia cuando una alarma se recupera antes de que la detección y la respuesta a los incidentes hayan completado la clasificación inicial.

    1. Antes de enviar la notificación en caso de que no haya ningún impacto, verifique y, a continuación, elimine los contactos de los clientes and/or agregados de Soporte Case CC en función de los contactos que figuran en los planes de interacción: plan de participación inicial.

      ["NO añadas contactos únicos"] (Aplicable si hay disponibles contactos de una sola vez).

    2. Envía una notificación de no interacción al cliente según la siguiente plantilla:

      Plantilla sin impacto

      AWS Incident Detection and Response received an alarm that has recovered for your workload. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Alarm End Time - <Example: 1 January 2025, 3:35 PM UTC> This may indicate a brief customer impact that is currently not ongoing. If there is an ongoing impact to your workload, please let us know and we will engage to assist.
    3. Pon el caso en espera de una acción del cliente.

    4. Si el cliente no responde en 30 minutos, resuelve el caso.

Descripción general de la arquitectura de aplicaciones

En esta sección se ofrece una descripción general de la application/workload arquitectura para que los ingenieros de gestión de incidentes y de operaciones conozcan mejor la arquitectura.

  • AWS Cuentas y regiones con servicios clave: lista de AWS cuentas en las que Regions admiten esta aplicación. Ayuda a los ingenieros a evaluar la infraestructura subyacente en la que se basa la aplicación.

    • 123456789012

      • US-EAST-1 - breve descripción, según corresponda

        • Amazon EC2: descripción breve, según proceda

        • DynamoDB: descripción breve, según proceda

        • etc.

      • US-WEST-1 - breve descripción, según proceda

        • etc.

    • otra cuenta

      • etc.