View a markdown version of this page

Desenvolva runbooks e planos de resposta para responder a um incidente na Detecção e Resposta a Incidentes - Guia do usuário de detecção e resposta a incidentes da AWS

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Desenvolva runbooks e planos de resposta para responder a um incidente na Detecção e Resposta a Incidentes

O AWS Incident Detection and Response usa informações capturadas durante a integração de sua carga de trabalho para desenvolver runbooks para o gerenciamento de incidentes que afetam suas cargas de trabalho. Os runbooks documentam as etapas que os gerentes de incidentes tomam ao responder a um incidente. Um plano de resposta é mapeado para pelo menos uma de suas cargas de trabalho. A equipe de gerenciamento de incidentes cria esses modelos a partir das informações fornecidas por você durante a integração da carga de trabalho.

Principais saídas:

  • Conclusão da definição de sua carga de trabalho no AWS Incident Detection and Response.

  • Conclusão de alarmes e runbooks sobre Detecção e Resposta a Incidentes da AWS.

Você também pode baixar um exemplo do AWS Incident Detection and Response Runbook: aws-idr-runbook-example.zip.

exemplo Exemplo de runbook
Description

Este documento é destinado a [CustomerName] - [WorkloadName].

Etapa: Prioridade

Ações prioritárias

  1. Envie a primeira correspondência sobre o Suporte caso para o cliente conforme abaixo.

Hello, This is <<Engineer's name>> from AWS Incident Detection and Response. An alarm has triggered for your workload <<Application_Name>>. I am currently investigating and will update you in a few minutes once I have finished initial investigation. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier>
Etapa: Informações

Planos de engajamento

Esta seção descreve os planos de engajamento aplicáveis a este runbook e contém somente detalhes de contato. Os planos de engajamento serão referenciados nos Planos de Comunicação passo a passo.

  • Engajamento inicial

    A equipe de detecção e resposta a incidentes da AWS adiciona abaixo os endereços das partes interessadas do cliente ao Suporte caso. AWS as partes interessadas são para outras partes interessadas que talvez precisem estar cientes de quaisquer problemas.

    • Partes interessadas do cliente: e-mail do cliente1; e-mail do cliente2; móvel1

    • AWS Partes interessadas: aws-idr-oncall@amazon.com; e-mail da equipe; etc.

    • Contatos únicos: [Esses são contatos de e-mail incluídos somente na primeira comunicação. Remova esses contatos depois que a primeira comunicação for enviada. Podem ser endereços de e-mail de paginação de clientes, como pager-duty, que não devem ser paginados para todas as correspondências. Adicione explicitamente instruções na seção “Prioridade”, “Planos de comunicação”, sobre como usá-los somente se o One Time Only Contacts estiver disponível.]

  • Configuração de chamada de incidente

    Indique se o cliente precisa do AWS Incident Detection and Response para criar uma ponte, se o cliente usa uma ponte estática ou se o cliente fornecerá uma ponte quando um incidente for aberto.

    (Escolha uma opção com base na preferência do cliente)

    • Detecção e resposta a incidentes da AWS criam um Amazon Chime/Zoom Bridge

    • Ponte estática fornecida pelo cliente

      • Número da conferência: < Insert Conference number >

    • O cliente fornece detalhes de ponte para cada incidente respondendo à comunicação enviada pela equipe de detecção e resposta a incidentes da AWS.

    • Outros - especifique os detalhes.

  • Aumento do engajamento

    O AWS Incident Detection and Response entrará em contato com os seguintes contatos quando os contatos do plano de engajamento inicial não responderem aos incidentes.

    Para cada contato de escalação, indique se ele deve ser adicionado ao Suporte caso, por telefone ou ambos.

    • Certifique-se de ter ligado para o contato do Initial Engagement, se aplicável, antes de escalar.

    • Primeiro contato de escalação: [escalation EmailAddress #1]/[PhoneNumber] - Aguarde XX minutos antes de encaminhar para esse contato.

      • [Adicionar contato ao caso/telefone] deste contato.

    • Segundo contato de escalação: [escalation EmailAddress #2]/[PhoneNumber] - Aguarde XX minutos antes de encaminhar para esse contato.

      • [Adicionar contato ao caso/telefone] deste contato.

    • etc.

Planos de comunicação

Esta seção descreve como os engenheiros de gerenciamento de incidentes se comunicam com as partes interessadas designadas fora dos canais de chamada e comunicação do incidente.

  • Plano de comunicação de impacto

    Esse plano é iniciado quando o AWS Incident Detection and Response determina, a partir da etapa de triagem, que um alerta indica um impacto potencial para um cliente.

    O AWS Incident Detection and Response solicitará que o cliente participe da ponte predeterminada, conforme indicado em Planos de engajamento — Configuração de chamadas de incidentes.

    (Escolha um dependendo se o One Time Only Contacts está disponível ou não.)

    1. Garanta que as partes interessadas do cliente usem os planos de engajamento - O engajamento inicial é adicionado ao caso CC.

    OU

    1. Garanta que as partes interessadas do cliente e os contatos únicos dos planos de engajamento - O engajamento inicial seja adicionado ao caso CC.

    2. Envie a notificação de engajamento ao cliente com base no seguinte modelo:

      (Escolha um)

      Modelo de impacto - Amazon Chime Bridge

      The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Amazon Chime Bridge below so we can start the steps outlined in your Runbook: Amazon Chime Meeting ID: <insert_Meeting_ID_here> Link to Amazon Chime Bridge: <insert_Link_here> International dial-in numbers: https://chime.aws/dialinnumbers/

      Modelo de impacto — Ponte fornecida pelo cliente

      The following alarm has engaged AWS Incident Detection and Response: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025 3:30 PM UTC> Please respond with your internal bridge details so we can join and start the steps outlined in your Runbook.

      Modelo de impacto - Customer Static Bridge

      The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert CloudWatch Alarm ARN or APM Response Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Bridge below so we can start the steps outlined in your Runbook: Conference Number: <insert_conference_number> Conference URL: <insert_bridge_URL>
    3. Defina o caso como Ação pendente do cliente.

    4. REMOVA os contatos únicos do caso após enviar a comunicação de impacto acima. (Se o recurso Contatos Únicos estiver disponível.)

    5. Siga o plano de escalonamento de engajamento conforme mencionado acima.

    6. Se o cliente não responder em 30 minutos, desative e continue monitorando até que o alarme se recupere.

  • Plano de comunicação sem impacto

    Esse plano é iniciado quando um alarme é recuperado antes que a detecção e a resposta a incidentes concluam a triagem inicial.

    1. Antes de enviar a notificação sem impacto, verifique e remova a and/or adição de contatos de clientes do Suporte Case CC com base nos contatos listados nos Planos de engajamento - Plano de engajamento inicial.

      ["NÃO adicione contatos únicos."] (Aplicável se o One Time Only Contacts estiver disponível.)

    2. Envie uma notificação de não engajamento ao cliente com base no modelo abaixo:

      Modelo sem impacto

      AWS Incident Detection and Response received an alarm that has recovered for your workload. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Alarm End Time - <Example: 1 January 2025, 3:35 PM UTC> This may indicate a brief customer impact that is currently not ongoing. If there is an ongoing impact to your workload, please let us know and we will engage to assist.
    3. Coloque o caso em Ação pendente do cliente.

    4. Se o cliente não responder em 30 minutos, resolva o caso.

Visão geral da arquitetura de aplicativos

Esta seção fornece uma visão geral da application/workload arquitetura para conscientização do engenheiro de gerenciamento de incidentes e do engenheiro de operações.

  • AWS Contas e regiões com os principais serviços - lista de AWS contas com regiões que suportam esse aplicativo. Auxilia os engenheiros na avaliação da infraestrutura subjacente que dá suporte ao aplicativo.

    • 123456789012

      • US-EAST-1 - breve descrição, conforme apropriado

        • Amazon EC2 — breve descrição, conforme apropriado

        • DynamoDB - breve descrição, conforme apropriado

        • etc.

      • US-WEST-1 - breve descrição, conforme apropriado

        • etc.

    • outra conta

      • etc.