Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Cuestionario sobre la incorporación de cargas de trabajo en Detección y respuesta a incidentes (ruta de excepción)
nota
Si no puede usar la CLI del IDR para incorporar su carga de trabajo, utilice el siguiente cuestionario para la incorporación de cargas de trabajo.
En este tema se incluye el cuestionario que debe completar para incorporar una carga de trabajo y configurar las alarmas para incorporarlas a AWS Incident Detection and Response. El cuestionario de incorporación de cargas de trabajo incluye información general sobre su carga de trabajo, los detalles de su arquitectura, las alarmas y los contactos para responder a los incidentes. En la sección de gestión de alarmas del cuestionario, especificas las alarmas críticas que activan la creación de incidentes en la sección Detección y respuesta de incidentes para tu carga de trabajo, así como la información del manual sobre con quién contactar y qué medidas tomar. Completar correctamente este cuestionario es un paso clave para configurar los procesos de supervisión y respuesta a incidentes para sus AWS cargas de trabajo.
Descargue el cuestionario de incorporación de Workload:
Detalles de la carga de trabajo: preguntas generales
| Pregunta | Respuesta de ejemplo |
|---|---|
| Nombre de la empresa | Amazon Inc. |
| Nombre de esta carga de trabajo (incluya cualquier abreviatura) | Amazon Retail Operations (ARO) |
| El usuario final principal y la función de esta carga de trabajo. | Esta carga de trabajo es una aplicación de comercio electrónico que permite a los usuarios finales comprar varios artículos. Esta carga de trabajo es el principal generador de ingresos para nuestro negocio. |
Detalles de la carga de trabajo: preguntas sobre arquitectura
| Pregunta | Respuesta de ejemplo |
|---|---|
Lista de etiquetas de AWS recursos que se utilizan para definir los recursos que forman parte de esta carga de trabajo. AWS usa estas etiquetas para identificar los recursos de esta carga de trabajo a fin de agilizar el soporte durante los incidentes. notaLas etiquetas distinguen entre mayúsculas y minúsculas. Si proporciona varias etiquetas, todos los recursos utilizados por esta carga de trabajo deben tener las mismas etiquetas. |
Nombre de la aplicación: Optimax entorno: Producción |
Una lista de Servicio de AWS los elementos utilizados por esta carga de Cuenta de AWS trabajo, los Región de AWS datos en los que se encuentran. |
Servicios de AWS: Route 53, ALB, ECS,... Cuentas: 123456789101, 123456789102,... US-EAST-1Regiones: US-WEST-2,,... |
Detalles de la carga de trabajo: preguntas sobre la ingestión de alarmas
En el caso de las preguntas sobre la ingestión de alarmas, debe especificar las alarmas críticas para su carga de trabajo a las que desea utilizar AWS Incident Detection and Response, así como los contactos a los que desea que contacte un ingeniero de gestión de incidentes cuando se activen estas alarmas.
La sección de administración de alarmas se divide en las siguientes secciones:
Sección de contacto: en primer lugar, especifique los contactos principales que se incluirán en el Soporte caso creado con AWS Incident Detection and Response cuando se active una alarma, así como su aplicación de conferencia preferida para resolver incidentes. Si no se proporciona ninguna preferencia de puente, AWS Incident Detection and Response creará un puente entre incidentes durante los incidentes. A continuación, especifique los contactos de escalamiento y los intervalos de tiempo para interactuar con ellos cuando no se pueda contactar con los contactos principales. Por último, haz una lista de los contactos que deberían recibir actualizaciones periódicas sobre el estado de los incidentes durante el caso de soporte mientras dure el incidente.
Matriz de alarmas: enumere el conjunto de alarmas que activarán la detección y la respuesta a los incidentes de AWS cuando se activen. Consulte los «criterios críticos de alarma» definidos por AWS Incident Detection and Response al seleccionar las alarmas para su incorporación. Para obtener más información, consulte Definición de alarma.
Amazon CloudWatch Alarms (deje esta sección en blanco si no tiene CloudWatch alarmas de Amazon)
Alarmas APM de terceros (deja esta sección en blanco si no tienes alarmas APM de terceros)
EventBridge EventBus ARN: es el ARN del EventBus ARN personalizado que creaste en o. Ingiera las alarmas de los APM con integración directa EventBridge Incorpore las alarmas de los APM sin una integración directa con EventBridge
Identificadores de alarma: comparta el número de cuenta, la región y el nombre de la alarma APM.
Contactos sobre la participación y la escalación de la carga de trabajo: preguntas del libro de ejercicios
| Pregunta | Respuesta de ejemplo |
|---|---|
AWS involucra a los contactos de carga de trabajo a lo largo del caso Soporte . ¿Quién es el contacto principal cuando se activa una alarma relacionada con esta carga de trabajo? Especifique su aplicación de conferencia preferida y AWS le solicitaremos estos detalles durante un incidente. notaSi no se proporciona una aplicación de conferencia preferida, nos pondremos en contacto contigo en caso de incidente y te AWS proporcionaremos un Chime bridge al que unirte. |
Equipo de aplicación app@example.com +61 2 3456 7890 |
Si el contacto principal no está disponible durante un incidente, indica los contactos de escalamiento y el cronograma en el orden de comunicación preferido. |
1. Transcurridos 10 minutos, si el contacto principal no responde, contacta con: John Smith, supervisor de solicitudes john.smith@example.com +61 2 3456 7890 2. Transcurridos 10 minutos, si John Smith no responde, póngase en contacto con: Jane Smith, directora de operaciones jane.smith@example.com +61 2 3456 7890 |
Matriz de alarmas
Proporcione la siguiente información para identificar el conjunto de alarmas que utilizarán la función de detección y respuesta a incidentes de AWS para generar incidentes en beneficio de su carga de trabajo. Una vez que los ingenieros de AWS Incident Detection and Response hayan revisado sus alarmas, se aplicarán los pasos de incorporación adicionales.
Criterios de alarma críticos para la detección y respuesta a incidentes de AWS:
Las alarmas de detección y respuesta a incidentes de AWS solo deben pasar al estado de «alarma» si la carga de trabajo monitorizada se ve afectada de forma significativa (pérdida de la experiencia del revenue/degraded cliente) y requiere la atención inmediata del operador.
Las alarmas de detección y respuesta a incidentes de AWS también deben hacer que los responsables de la resolución se ocupen de la carga de trabajo al mismo tiempo o antes de la contratación. AWS Los administradores de incidentes colaboran con las personas que resuelven los problemas en el proceso de mitigación y no actúan como personal de primera línea para luego ponerse en contacto con usted.
Los umbrales de alarma de detección y respuesta a incidentes de AWS deben establecerse en un umbral y una duración adecuados para que cada vez que se active una alarma se lleve a cabo una investigación. Si una alarma oscila entre el estado «Alarma» y el estado «OK», se está produciendo un impacto suficiente como para garantizar la respuesta y la atención del operador.
Política de detección y respuesta a incidentes de AWS en caso de incumplimiento de criterios:
Estos criterios solo se pueden evaluar caso por caso a medida que se producen eventos. El equipo de gestión de incidentes colabora con sus gestores técnicos de cuentas (TAM) para ajustar las alarmas y, en raras ocasiones, desactivar la supervisión si se sospecha que las alarmas de los clientes no cumplen con este criterio y están contratando al equipo de gestión de incidentes de forma innecesaria y regular.
importante
Proporcione una dirección de correo electrónico de distribución grupal cuando proporcione las direcciones de contacto, de modo que pueda controlar la incorporación y eliminación de destinatarios sin necesidad de actualizar el libro de ejecución.
Indique el número de teléfono de contacto del equipo de ingeniería de confiabilidad (SRE) de su sitio si desea que el equipo de detección y respuesta a incidentes de AWS lo llame después de enviar un correo electrónico de compromiso inicial.
CloudWatch alarma ARN |
Contacto principal de esta alarma. (Si es diferente del contacto principal de la carga de trabajo) |
Especifique la más relevante Servicio de AWS para esta alarma a fin de contratar al ingeniero adecuado. Ingresa N/A si no es necesario. |
Ejemplo:
|
Ejemplo: Sam Smith - Gestor de aplicaciones sam.smith@example.com +61 2 3456 7890 |
Ejemplo: ECS |
EventBridge ARN de Event Bus (Se crea como parte de la integración de APM de terceros para enviar las alertas a AWS Incident Detection and Response). |
Ejemplo: (Habrá un bus de eventos por Account/Region combinación)
|
||
Identificador de alarma |
¿Qué representa esta métrica? ¿Por qué es importante esta alarma? |
Contacto principal de esta alarma. (Si es diferente del contacto principal de la carga de trabajo) |
Especifique la más relevante Servicio de AWS para esta alarma a fin de contratar al ingeniero adecuado. Ingresa N/A si no es necesario. |
Ejemplo: ALB_5xx_ Target_Response ID de cuenta: 123456789012 Región: us-east-1 |
Ejemplo: Esta métrica representa las respuestas a las transacciones de los objetivos que están detrás de la ALB. Si los errores 5XX superan el umbral, se trata de una falla crítica a la hora de procesar las transacciones comerciales. |
Ejemplo: Sam Smith: gerente de aplicaciones sam.smith@example.com +61 2 3456 7890 |
Ejemplo: ECS |