As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Desenvolva runbooks e planos de resposta para responder a um incidente em Detecção e Resposta a Incidentes
O AWS Incident Detection and Response usa informações capturadas da integração do IDR CLI para desenvolver runbooks para o gerenciamento de incidentes que afetam suas cargas de trabalho. Os runbooks documentam as etapas que os gerentes de incidentes realizam ao responder a um incidente. Um plano de resposta é mapeado para pelo menos uma de suas cargas de trabalho. A equipe de gerenciamento de incidentes cria esses modelos a partir das informações fornecidas por você durante a integração da carga de trabalho.
Principais saídas:
-
Conclusão da definição de sua carga de trabalho no AWS Incident Detection and Response.
-
Conclusão de alarmes e runbooks sobre o AWS Incident Detection and Response.
Você também pode baixar um exemplo do AWS Incident Detection and Response Runbook: aws-idr-runbook-example.zip.
exemplo Exemplo de runbook
Description
Este documento é destinado a [CustomerName] - [WorkloadName].
Etapa: Prioridade
Ações prioritárias
-
Envie a primeira correspondência sobre o Suporte caso para o cliente conforme abaixo.
Hello, This is <<Engineer's name>> from AWS Incident Detection and Response. An alarm has triggered for your workload <<Application_Name>>. I am currently investigating and will update you in a few minutes once I have finished initial investigation. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier>
Etapa: Informações
Planos de engajamento
Esta seção descreve os planos de engajamento aplicáveis a este runbook e contém somente detalhes de contato. Os planos de engajamento serão referenciados nos Planos de Comunicação passo a passo.
-
Engajamento inicial
A equipe de detecção e resposta a incidentes da AWS adiciona os endereços das partes interessadas do cliente abaixo ao Suporte caso. AWS as partes interessadas são para outras partes interessadas que talvez precisem ser informadas sobre quaisquer problemas.
Partes interessadas do cliente: e-mail do cliente 1; e-mail do cliente 2; celular 1
AWS Partes interessadas: aws-idr-oncall@amazon.com; e-mail da equipe de equipe; etc.
Contatos únicos: [Esses são contatos de e-mail incluídos somente na primeira comunicação. Remova esses contatos após o término da primeira comunicação. Podem ser endereços de e-mail de paginação de clientes, como pager-duty, que não devem ser paginados em todas as correspondências. Adicione explicitamente instruções na seção “Prioridade”, “Planos de comunicação” sobre como usá-los somente se os Contatos Únicos estiverem disponíveis.]
-
Configuração de chamada de incidente
Indique se o cliente precisa do AWS Incident Detection and Response para criar uma ponte, se o cliente usa uma ponte estática ou se o cliente fornecerá uma ponte quando um incidente for aberto.
(Escolha uma opção com base na preferência do cliente)
AWS Incident Detection and Response criam uma Amazon Chime/Zoom Bridge
-
Ponte estática fornecida pelo cliente
Número da conferência: < Insert Conference number >
O cliente fornece detalhes sobre cada incidente respondendo à comunicação enviada pela equipe de detecção e resposta a incidentes da AWS.
Outros - Especifique os detalhes.
-
Escalonamento do engajamento
O AWS Incident Detection and Response entrará em contato com os seguintes contatos quando os contatos do plano de engajamento inicial não responderem aos incidentes.
Para cada contato de escalonamento, indique se eles devem ser adicionados ao Suporte caso, telefonados ou ambos.
Certifique-se de ter ligado para o contato inicial de engajamento, se aplicável, antes de escalar.
-
Primeiro contato de escalonamento: [escalation EmailAddress #1]/[PhoneNumber] - Aguarde XX minutos antes de escalar para esse contato.
[Adicionar contato ao caso/telefone] esse contato.
-
Segundo contato de escalonamento: [escalation EmailAddress #2]/[PhoneNumber] - Aguarde XX minutos antes de escalar para esse contato.
[Adicionar contato ao caso/telefone] este contato.
etc.
Planos de comunicação
Esta seção descreve como os engenheiros de gerenciamento de incidentes se comunicam com as partes interessadas designadas fora dos canais de comunicação e chamada de incidentes.
-
Plano de comunicação de impacto
Esse plano é iniciado quando o AWS Incident Detection and Response determinou, a partir da etapa de triagem, que um alerta indica um impacto potencial para o cliente.
O AWS Incident Detection and Response solicitará que o cliente participe da ponte predeterminada, conforme indicado em Planos de engajamento — Configuração de chamadas de incidentes.
(Escolha um, dependendo se os Contatos Somente Uma Vez estão disponíveis ou não.)
Garanta que as partes interessadas do cliente usem os planos de engajamento - o engajamento inicial é adicionado ao CC do caso.
OU
Garanta que as partes interessadas do cliente e os contatos únicos dos planos de engajamento - o engajamento inicial sejam adicionados ao CC do caso.
Envie a notificação de engajamento ao cliente com base no seguinte modelo:
(Escolha um)
Modelo de impacto - Amazon Chime Bridge
The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Amazon Chime Bridge below so we can start the steps outlined in your Runbook: Amazon Chime Meeting ID: <insert_Meeting_ID_here> Link to Amazon Chime Bridge: <insert_Link_here> International dial-in numbers: https://chime.aws/dialinnumbers/Modelo de impacto - Ponte fornecida pelo cliente
The following alarm has engaged AWS Incident Detection and Response: Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025 3:30 PM UTC> Please respond with your internal bridge details so we can join and start the steps outlined in your Runbook.Modelo de impacto - Customer Static Bridge
The following alarm has engaged AWS Incident Detection and Response to an Incident bridge: Alarm Identifier - <insert CloudWatch Alarm ARN or APM Response Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Please join the Bridge below so we can start the steps outlined in your Runbook: Conference Number: <insert_conference_number> Conference URL: <insert_bridge_URL>Defina o caso como Ação pendente do cliente.
REMOVA os contatos únicos do estojo após enviar a Comunicação de impacto acima. (Se somente contatos ocasionais estiverem disponíveis.)
Siga o plano de escalonamento de engajamento conforme mencionado acima.
Se o cliente não responder em 30 minutos, desative e continue monitorando até que o alarme se recupere.
-
Plano de comunicação sem impacto
Esse plano é iniciado quando um alarme é recuperado antes que a Detecção e a Resposta a Incidentes concluam a triagem inicial.
-
Antes de enviar a notificação sem impacto, verifique e, em seguida, remova a and/or adição de contatos do cliente do Suporte Case CC com base nos contatos listados em Planos de engajamento - Plano de engajamento inicial.
["NÃO adicione contatos únicos."] (Aplicável se somente contatos ocasionais estiverem disponíveis.)
Envie uma notificação de não engajamento ao cliente com base no modelo abaixo:
Modelo sem impacto
AWS Incident Detection and Response received an alarm that has recovered for your workload. Alarm Identifier - <insert_CloudWatch_Alarm_ARN_or_APM_Response_Identifier> Alarm State Change Reason - <insert_state_change_reason> Alarm Start Time - <Example: 1 January 2025, 3:30 PM UTC> Alarm End Time - <Example: 1 January 2025, 3:35 PM UTC> This may indicate a brief customer impact that is currently not ongoing. If there is an ongoing impact to your workload, please let us know and we will engage to assist.Coloque o caso em Ação pendente do cliente.
Se o cliente não responder em 30 minutos, resolva o caso.
-
Visão geral da arquitetura de aplicativos
Esta seção fornece uma visão geral da application/workload arquitetura para conscientização do engenheiro de gerenciamento de incidentes e do engenheiro de operações.
-
AWS Contas e regiões com os principais serviços - lista de AWS contas com regiões que suportam este aplicativo. Auxilia os engenheiros na avaliação da infraestrutura subjacente que dá suporte ao aplicativo.
-
123456789012
-
US-EAST-1 - breve descrição, conforme apropriado
Amazon EC2 — breve descrição, conforme apropriado
DynamoDB - breve descrição, conforme apropriado
etc.
-
US-WEST-1 - breve descrição, conforme apropriado
etc.
-
-
outra conta
etc.
-