View a markdown version of this page

CloudWatch Alarmas recomendadas para los clústeres aprovisionados de Amazon MSK - Transmisión administrada de Amazon para Apache Kafka

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

CloudWatch Alarmas recomendadas para los clústeres aprovisionados de Amazon MSK

Supervise los clústeres aprovisionados de Amazon MSK para detectar problemas antes de que afecten a sus aplicaciones. CloudWatch las alarmas realizan una acción cuando una CloudWatch métrica supera un valor especificado durante un período de tiempo determinado. Por ejemplo, es posible que desee recibir una notificación por correo electrónico si el recuento de particiones supera el valor recomendado para el tamaño de la instancia de su intermediario durante más de 15 minutos. Se recomiendan las alarmas críticas de la tabla siguiente, pero no son una lista exhaustiva de las alarmas que puede crear para supervisar su clúster.

Para obtener más información sobre la configuración de alarmas, consulte Creación de CloudWatch alarmas de Amazon en la Guía del CloudWatch usuario de Amazon.

En la siguiente tabla se enumeran las alarmas que se aplican tanto a los agentes Standard como a los Express.

Alarma Problema

CPUUser+ CPUSystem Promedio >= 60 durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Uno o más corredores tienen un promedio de CPU/usuario+sistema de CPU superior al 60% recomendado. Para obtener más información, consulte Supervisisión del uso de CPU.

PartitionCountPromedio >= X durante 5 minutos, 3 veces consecutivas (X = recuento de particiones recomendado para el tamaño de la instancia del bróker)

Dimensiones: Cluster Name, Broker ID

Uno o más agentes tienen particiones que superan el límite de número de particiones recomendado. Para obtener más información, consulte Right-size su clúster: número de particiones por intermediario estándar y Cuota de particiones de agentes Express.

SumOffsetLagPromedio >= X durante 5 minutos, 3 veces consecutivas (X se establece para una combinación de grupo de consumidores y tema según el caso práctico)

Dimensiones: Cluster Name, Consumer Group, Topic

El retraso de compensación agregado para todas las particiones de un tema es superior a X. Para obtener más información sobre el retraso, puedes usar la Offset métrica a nivel de partición, que representa el retraso de cada partición, o usar la herramienta de línea de comandos de Kafka para describir el grupo de consumidores. Revisa la velocidad de procesamiento de tu solicitud de consumo en relación con los fabricantes para saber si los consumidores no son capaces de mantener el ritmo y comprueba si algún reequilibrio entre los consumidores está ralentizando a los consumidores.

En la siguiente tabla se enumeran las alarmas que se aplican únicamente a los corredores estándar.

Alarma Problema

OfflinePartitionsCountPromedio >= 1 durante 1 minuto, 3 veces consecutivas

Dimensiones: Cluster Name

Una o más particiones de temas no están disponibles. Cuando las particiones no están disponibles, las operaciones de producción y consumo de esas particiones fallan. Las particiones sin conexión no deben estar en un clúster bien equilibrado, con el tamaño y la configuración correctos. Para obtener más información, consulte Crear clústeres de alta disponibilidad.

UnderMinIsrPartitionCountPromedio >= 1 durante 1 minuto, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Uno o más temas tienen particiones por debajo del conjunto de réplicas sincronizadas (ISR) mínimo configurado. Cuando las particiones están por debajo del ISR mínimo, las operaciones de producción fallan (con el productor). acks=all Para obtener más información, consulte Crear clústeres de alta disponibilidad.

KafkaDataLogsDiskUsedPromedio >= 80 durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Uno o más corredores utilizan discos de datos del 80% o más. Para obtener más información, consulte Monitorear el espacio en disco.

HeapMemoryAfterGCPromedio >= 60 durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Uno o más corredores tienen en uso el 60% o más de la memoria acumulada total después de la recolección de basura. Para obtener más información, consulte Supervisión de la memoria de Apache Kafka.

(Sum (VolumeReadBytes) + Sum (VolumeWriteBytes))/(5 * 60 * 1024 * 1024) >= X MiB durante 5 minutos, 3 veces consecutivas (X = 80% del rendimiento del volumen disponible)

Dimensiones: Cluster Name, Broker ID

Uno o más corredores tienen un volumen subyacente de lectura y escritura que consume hasta el 80% del volumen de trabajo disponible. Para obtener más información, consulte Rendimiento del almacenamiento aprovisionado.

CPUCreditBalancePromedio <= 100 durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Esto solo es relevante para el tipo de bróker t3.small. Uno o más corredores han agotado su saldo crediticio de CPU de un máximo de 576 a menos de 100. Cuando el saldo llega a 0, el bróker no puede superar la línea base de CPU del 20%. Para evitar que se agoten los créditos de la CPU, actualice de una instancia de intermediario t3 a una instancia de tipo m7g, que no utiliza créditos de CPU.

RequestHandlerAvgIdlePercentPromedio <= 0,3 durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Uno o más agentes están registrando una congestión de actividad en el grupo de subprocesos responsable de atender las solicitudes (el grupo de subprocesos está inactivo en menos del 30%). En este caso, la saturación indica que las solicitudes son lentas, lo que puede provocar tiempos de espera en el cliente. Además, comprueba si tus clientes generan solicitudes excesivas. Por ejemplo, los clientes no autorizados pueden estar reintentando de forma agresiva las solicitudes que los corredores rechazan. Para obtener más información sobre cómo optimizar el rendimiento del clúster, consulte. Optimización del rendimiento de los clústeres para instancias m5.4xl, m7g.4xl o más grandes

NetworkProcessorAvgIdlePercentPromedio <= 0.3 durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

Uno o más corredores están registrando una congestión de actividad en el grupo de subprocesos de conexión de red (el grupo de subprocesos está inactivo en menos del 30%). La saturación en este caso puede provocar tiempos de espera. Además, comprueba si tus clientes generan solicitudes excesivas. Por ejemplo, los clientes no autorizados pueden estar reintentando de forma agresiva las solicitudes que los corredores rechazan. Para obtener más información sobre cómo optimizar el rendimiento del clúster, consulte. Optimización del rendimiento de los clústeres para instancias m5.4xl, m7g.4xl o más grandes

KafkaFileDescriptorsUsagePercent> 80% durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

El porcentaje de descriptores de archivos en uso en el bróker. Con un agotamiento del 100%, es posible que el corredor de Kafka no pueda empezar. El recuento de descriptores de archivos aumenta con el número de particiones, el número de segmentos de registro en cada partición y el número de conexiones de clientes. Compruebe si hay temas con segment.ms valores bajos que provoquen una tirada frecuente de registros y considere la posibilidad de reducir el número de conexiones de clientes.

KafkaMemoryMappedFilesUsagePercent> 80% durante 5 minutos, 3 veces consecutivas

Dimensiones: Cluster Name, Broker ID

El porcentaje de archivos mapeados en memoria que se utilizan en el bróker. Si se agota al 100%, es posible que el corredor de Kafka no pueda empezar. El recuento de uso de los archivos mapeados en memoria aumenta con el número de particiones y el número de segmentos de registro en cada partición. Compruebe si hay temas con segment.ms valores bajos que generen tiradas frecuentes de registros.

Alarmas de control de acceso de IAM

Además de las alarmas anteriores, recomendamos crear alarmas para las siguientes métricas específicas del control de acceso de IAM. Estas alarmas se aplican tanto a los corredores estándar como a los express que tienen habilitada la autenticación de IAM. Amazon MSK establece límites lógicos a las conexiones de IAM para proteger al agente de la sobrecarga de solicitudes de conexión de IAM. Si se infringe cualquiera de estos límites, se agotan las conexiones de los clientes, lo que repercutirá en su carga de trabajo.

Alarma Problema

ClientConnectionCountSuma >= X durante 1 minuto, 3 veces consecutivas (X = el 80% del máximo de conexiones TCP por intermediario)

Dimensiones: Cluster Name, Broker ID, Client Authentication

Uno o más agentes tienen un recuento de conexiones igual al 80% del límite de conexiones. El número máximo predeterminado de conexiones TCP por intermediario para el control de acceso de IAM es de 3000. Este valor se puede cambiar. Para obtener más información, consulte Cuota de agentes Express de Amazon MSK para los corredores Express y Cuota estándar de agentes de Amazon MSK para los corredores Standard.

ConnectionCreationRateSuma >= X durante 1 minuto, 3 veces consecutivas (X = el 80% del límite de velocidad de creación de conexiones para el tamaño de la instancia)

Dimensiones: Cluster Name, Broker ID

Uno o más agentes tienen clientes que crean conexiones de IAM a un ritmo igual al 80% de su límite de velocidad de creación de conexiones. La velocidad máxima de conexiones TCP por agente para el control de acceso de IAM depende del tamaño de la instancia. Para obtener más información, consulte Cuota de agentes Express de Amazon MSK para los corredores Express y Cuota estándar de agentes de Amazon MSK para los corredores Standard.