Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
CloudWatch Alarmas recomendadas para los clústeres aprovisionados de Amazon MSK
Supervise los clústeres aprovisionados de Amazon MSK para detectar problemas antes de que afecten a sus aplicaciones. CloudWatch las alarmas realizan una acción cuando una CloudWatch métrica supera un valor especificado durante un período de tiempo determinado. Por ejemplo, es posible que desee recibir una notificación por correo electrónico si el recuento de particiones supera el valor recomendado para el tamaño de la instancia de su intermediario durante más de 15 minutos. Se recomiendan las alarmas críticas de la tabla siguiente, pero no son una lista exhaustiva de las alarmas que puede crear para supervisar su clúster.
Para obtener más información sobre la configuración de alarmas, consulte Creación de CloudWatch alarmas de Amazon en la Guía del CloudWatch usuario de Amazon.
En la siguiente tabla se enumeran las alarmas que se aplican tanto a los agentes Standard como a los Express.
| Alarma | Problema |
|---|---|
|
Dimensiones: |
Uno o más corredores tienen un promedio de CPU/usuario+sistema de CPU superior al 60% recomendado. Para obtener más información, consulte Supervisisión del uso de CPU. |
|
Dimensiones: |
Uno o más agentes tienen particiones que superan el límite de número de particiones recomendado. Para obtener más información, consulte Right-size su clúster: número de particiones por intermediario estándar y Cuota de particiones de agentes Express. |
|
Dimensiones: |
El retraso de compensación agregado para todas las particiones de un tema es superior a X. Para obtener más información sobre el retraso, puedes usar la |
En la siguiente tabla se enumeran las alarmas que se aplican únicamente a los corredores estándar.
| Alarma | Problema |
|---|---|
|
Dimensiones: |
Una o más particiones de temas no están disponibles. Cuando las particiones no están disponibles, las operaciones de producción y consumo de esas particiones fallan. Las particiones sin conexión no deben estar en un clúster bien equilibrado, con el tamaño y la configuración correctos. Para obtener más información, consulte Crear clústeres de alta disponibilidad. |
|
Dimensiones: |
Uno o más temas tienen particiones por debajo del conjunto de réplicas sincronizadas (ISR) mínimo configurado. Cuando las particiones están por debajo del ISR mínimo, las operaciones de producción fallan (con el productor). |
|
Dimensiones: |
Uno o más corredores utilizan discos de datos del 80% o más. Para obtener más información, consulte Monitorear el espacio en disco. |
|
Dimensiones: |
Uno o más corredores tienen en uso el 60% o más de la memoria acumulada total después de la recolección de basura. Para obtener más información, consulte Supervisión de la memoria de Apache Kafka. |
|
(Sum ( Dimensiones: |
Uno o más corredores tienen un volumen subyacente de lectura y escritura que consume hasta el 80% del volumen de trabajo disponible. Para obtener más información, consulte Rendimiento del almacenamiento aprovisionado. |
|
Dimensiones: |
Esto solo es relevante para el tipo de bróker t3.small. Uno o más corredores han agotado su saldo crediticio de CPU de un máximo de 576 a menos de 100. Cuando el saldo llega a 0, el bróker no puede superar la línea base de CPU del 20%. Para evitar que se agoten los créditos de la CPU, actualice de una instancia de intermediario t3 a una instancia de tipo m7g, que no utiliza créditos de CPU. |
|
Dimensiones: |
Uno o más agentes están registrando una congestión de actividad en el grupo de subprocesos responsable de atender las solicitudes (el grupo de subprocesos está inactivo en menos del 30%). En este caso, la saturación indica que las solicitudes son lentas, lo que puede provocar tiempos de espera en el cliente. Además, comprueba si tus clientes generan solicitudes excesivas. Por ejemplo, los clientes no autorizados pueden estar reintentando de forma agresiva las solicitudes que los corredores rechazan. Para obtener más información sobre cómo optimizar el rendimiento del clúster, consulte. Optimización del rendimiento de los clústeres para instancias m5.4xl, m7g.4xl o más grandes |
|
Dimensiones: |
Uno o más corredores están registrando una congestión de actividad en el grupo de subprocesos de conexión de red (el grupo de subprocesos está inactivo en menos del 30%). La saturación en este caso puede provocar tiempos de espera. Además, comprueba si tus clientes generan solicitudes excesivas. Por ejemplo, los clientes no autorizados pueden estar reintentando de forma agresiva las solicitudes que los corredores rechazan. Para obtener más información sobre cómo optimizar el rendimiento del clúster, consulte. Optimización del rendimiento de los clústeres para instancias m5.4xl, m7g.4xl o más grandes |
|
Dimensiones: |
El porcentaje de descriptores de archivos en uso en el bróker. Con un agotamiento del 100%, es posible que el corredor de Kafka no pueda empezar. El recuento de descriptores de archivos aumenta con el número de particiones, el número de segmentos de registro en cada partición y el número de conexiones de clientes. Compruebe si hay temas con |
|
Dimensiones: |
El porcentaje de archivos mapeados en memoria que se utilizan en el bróker. Si se agota al 100%, es posible que el corredor de Kafka no pueda empezar. El recuento de uso de los archivos mapeados en memoria aumenta con el número de particiones y el número de segmentos de registro en cada partición. Compruebe si hay temas con |
Alarmas de control de acceso de IAM
Además de las alarmas anteriores, recomendamos crear alarmas para las siguientes métricas específicas del control de acceso de IAM. Estas alarmas se aplican tanto a los corredores estándar como a los express que tienen habilitada la autenticación de IAM. Amazon MSK establece límites lógicos a las conexiones de IAM para proteger al agente de la sobrecarga de solicitudes de conexión de IAM. Si se infringe cualquiera de estos límites, se agotan las conexiones de los clientes, lo que repercutirá en su carga de trabajo.
| Alarma | Problema |
|---|---|
|
Dimensiones: |
Uno o más agentes tienen un recuento de conexiones igual al 80% del límite de conexiones. El número máximo predeterminado de conexiones TCP por intermediario para el control de acceso de IAM es de 3000. Este valor se puede cambiar. Para obtener más información, consulte Cuota de agentes Express de Amazon MSK para los corredores Express y Cuota estándar de agentes de Amazon MSK para los corredores Standard. |
|
Dimensiones: |
Uno o más agentes tienen clientes que crean conexiones de IAM a un ritmo igual al 80% de su límite de velocidad de creación de conexiones. La velocidad máxima de conexiones TCP por agente para el control de acceso de IAM depende del tamaño de la instancia. Para obtener más información, consulte Cuota de agentes Express de Amazon MSK para los corredores Express y Cuota estándar de agentes de Amazon MSK para los corredores Standard. |