

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

# CloudWatch Alarmas recomendadas para los clústeres aprovisionados de Amazon MSK
<a name="bestpractices-cw-alarms"></a>

Supervise los clústeres aprovisionados de Amazon MSK para detectar problemas antes de que afecten a sus aplicaciones. CloudWatch las alarmas realizan una acción cuando una CloudWatch métrica supera un valor especificado durante un período de tiempo determinado. Por ejemplo, es posible que desee recibir una notificación por correo electrónico si el recuento de particiones supera el valor recomendado para el tamaño de la instancia de su intermediario durante más de 15 minutos. Se recomiendan las alarmas críticas de la tabla siguiente, pero no son una lista exhaustiva de las alarmas que puede crear para supervisar su clúster.

Para obtener más información sobre la configuración de alarmas, consulte [ Creación de CloudWatch alarmas de Amazon ](https://docs.aws.amazon.com/AmazonCloudWatch/latest/monitoring/AlarmThatSendsEmail.html) en la Guía del CloudWatch usuario de * Amazon*.

En la siguiente tabla se enumeran las alarmas que se aplican tanto a los agentes Standard como a los Express.


| Alarma | Problema | 
| --- | --- | 
| `CPUUser`\+ `CPUSystem` Promedio >= 60 durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más corredores tienen un promedio de CPU/usuario\+sistema de CPU superior al 60% recomendado. Para obtener más información, consulte [Supervisisión del uso de CPU](bestpractices.md#bestpractices-monitor-cpu). | 
| `PartitionCount`Promedio >= * X * durante 5 minutos, 3 veces consecutivas (*X * = recuento de particiones recomendado para el tamaño de la instancia del bróker)<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más agentes tienen particiones que superan el límite de número de particiones recomendado. Para obtener más información, consulte [Right-size su clúster: número de particiones por intermediario estándar](bestpractices.md#partitions-per-broker) y [Cuota de particiones de agentes Express](limits.md#msk-express-broker-partition-quota). | 
| `SumOffsetLag`Promedio >= * X * durante 5 minutos, 3 veces consecutivas (*X * se establece para una combinación de grupo de consumidores y tema según el caso práctico)<br />Dimensiones: `Cluster Name`, `Consumer Group`, `Topic` | El retraso de compensación agregado para todas las particiones de un tema es superior a * X. * Para obtener más información sobre el retraso, puedes usar la `Offset` métrica a nivel de partición, que representa el retraso de cada partición, o usar la herramienta de línea de comandos de Kafka para describir el grupo de consumidores. Revisa la velocidad de procesamiento de tu solicitud de consumo en relación con los fabricantes para saber si los consumidores no son capaces de mantener el ritmo y comprueba si algún reequilibrio entre los consumidores está ralentizando a los consumidores. | 

En la siguiente tabla se enumeran las alarmas que se aplican únicamente a los corredores estándar.


| Alarma | Problema | 
| --- | --- | 
| `OfflinePartitionsCount`Promedio >= 1 durante 1 minuto, 3 veces consecutivas<br />Dimensiones: `Cluster Name` | Una o más particiones de temas no están disponibles. Cuando las particiones no están disponibles, las operaciones de producción y consumo de esas particiones fallan. Las particiones sin conexión no deben estar en un clúster bien equilibrado, con el tamaño y la configuración correctos. Para obtener más información, consulte [Crear clústeres de alta disponibilidad](bestpractices.md#ensure-high-availability). | 
| `UnderMinIsrPartitionCount`Promedio >= 1 durante 1 minuto, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más temas tienen particiones por debajo del conjunto de réplicas sincronizadas (ISR) mínimo configurado. Cuando las particiones están por debajo del ISR mínimo, las operaciones de producción fallan (con el productor). `acks=all` Para obtener más información, consulte [Crear clústeres de alta disponibilidad](bestpractices.md#ensure-high-availability). | 
| `KafkaDataLogsDiskUsed`Promedio >= 80 durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más corredores utilizan discos de datos del 80% o más. Para obtener más información, consulte [Monitorear el espacio en disco](bestpractices.md#bestpractices-monitor-disk-space). | 
| `HeapMemoryAfterGC`Promedio >= 60 durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más corredores tienen en uso el 60% o más de la memoria acumulada total después de la recolección de basura. Para obtener más información, consulte [Supervisión de la memoria de Apache Kafka](bestpractices.md#bestpractices-monitor-memory). | 
| (Sum (`VolumeReadBytes`) \+ Sum (`VolumeWriteBytes`))/(5 \* 60 \* 1024 \* 1024) >= * X * MiB durante 5 minutos, 3 veces consecutivas (*X * = 80% del rendimiento del volumen disponible)<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más corredores tienen un volumen subyacente de lectura y escritura que consume hasta el 80% del volumen de trabajo disponible. Para obtener más información, consulte Rendimiento [ del almacenamiento ](https://docs.aws.amazon.com/msk/latest/developerguide/msk-provision-throughput-management.html) aprovisionado. | 
| `CPUCreditBalance`Promedio <= 100 durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Esto solo es relevante para el tipo de bróker t3.small. Uno o más corredores han agotado su saldo crediticio de CPU de un máximo de 576 a menos de 100. Cuando el saldo llega a 0, el bróker no puede superar la línea base de CPU del 20%. Para evitar que se agoten los créditos de la CPU, actualice de una instancia de intermediario t3 a una instancia de tipo m7g, que no utiliza créditos de CPU. | 
| `RequestHandlerAvgIdlePercent`Promedio <= 0,3 durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más agentes están registrando una congestión de actividad en el grupo de subprocesos responsable de atender las solicitudes (el grupo de subprocesos está inactivo en menos del 30%). En este caso, la saturación indica que las solicitudes son lentas, lo que puede provocar tiempos de espera en el cliente. Además, comprueba si tus clientes generan solicitudes excesivas. Por ejemplo, los clientes no autorizados pueden estar reintentando de forma agresiva las solicitudes que los corredores rechazan. Para obtener más información sobre cómo optimizar el rendimiento del clúster, consulte. [Optimización del rendimiento de los clústeres para instancias m5.4xl, m7g.4xl o más grandes](bestpractices.md#optimize-broker-threads) | 
| `NetworkProcessorAvgIdlePercent`Promedio <= 0.3 durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más corredores están registrando una congestión de actividad en el grupo de subprocesos de conexión de red (el grupo de subprocesos está inactivo en menos del 30%). La saturación en este caso puede provocar tiempos de espera. Además, comprueba si tus clientes generan solicitudes excesivas. Por ejemplo, los clientes no autorizados pueden estar reintentando de forma agresiva las solicitudes que los corredores rechazan. Para obtener más información sobre cómo optimizar el rendimiento del clúster, consulte. [Optimización del rendimiento de los clústeres para instancias m5.4xl, m7g.4xl o más grandes](bestpractices.md#optimize-broker-threads) | 
| `KafkaFileDescriptorsUsagePercent`> 80% durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | El porcentaje de descriptores de archivos en uso en el bróker. Con un agotamiento del 100%, es posible que el corredor de Kafka no pueda empezar. El recuento de descriptores de archivos aumenta con el número de particiones, el número de segmentos de registro en cada partición y el número de conexiones de clientes. Compruebe si hay temas con `segment.ms` valores bajos que provoquen una tirada frecuente de registros y considere la posibilidad de reducir el número de conexiones de clientes. | 
| `KafkaMemoryMappedFilesUsagePercent`> 80% durante 5 minutos, 3 veces consecutivas<br />Dimensiones: `Cluster Name`, `Broker ID` | El porcentaje de archivos mapeados en memoria que se utilizan en el bróker. Si se agota al 100%, es posible que el corredor de Kafka no pueda empezar. El recuento de uso de los archivos mapeados en memoria aumenta con el número de particiones y el número de segmentos de registro en cada partición. Compruebe si hay temas con `segment.ms` valores bajos que generen tiradas frecuentes de registros. | 

## Alarmas de control de acceso de IAM
<a name="bestpractices-cw-alarms-iam"></a>

Además de las alarmas anteriores, recomendamos crear alarmas para las siguientes métricas específicas del control de acceso de IAM. Estas alarmas se aplican tanto a los corredores estándar como a los express que tienen habilitada la autenticación de IAM. Amazon MSK establece límites lógicos a las conexiones de IAM para proteger al agente de la sobrecarga de solicitudes de conexión de IAM. Si se infringe cualquiera de estos límites, se agotan las conexiones de los clientes, lo que repercutirá en su carga de trabajo.


| Alarma | Problema | 
| --- | --- | 
| `ClientConnectionCount`Suma >= * X * durante 1 minuto, 3 veces consecutivas (*X * = el 80% del máximo de conexiones TCP por intermediario)<br />Dimensiones: `Cluster Name`, `Broker ID`, `Client Authentication` | Uno o más agentes tienen un recuento de conexiones igual al 80% del límite de conexiones. El número máximo predeterminado de conexiones TCP por intermediario para el control de acceso de IAM es de 3000. Este valor se puede cambiar. Para obtener más información, consulte [Cuota de agentes Express de Amazon MSK](limits.md#msk-express-quota) para los corredores Express y [Cuota estándar de agentes de Amazon MSK](limits.md#msk-provisioned-quota) para los corredores Standard. | 
| `ConnectionCreationRate`Suma >= * X * durante 1 minuto, 3 veces consecutivas (*X * = el 80% del límite de velocidad de creación de conexiones para el tamaño de la instancia)<br />Dimensiones: `Cluster Name`, `Broker ID` | Uno o más agentes tienen clientes que crean conexiones de IAM a un ritmo igual al 80% de su límite de velocidad de creación de conexiones. La velocidad máxima de conexiones TCP por agente para el control de acceso de IAM depende del tamaño de la instancia. Para obtener más información, consulte [Cuota de agentes Express de Amazon MSK](limits.md#msk-express-quota) para los corredores Express y [Cuota estándar de agentes de Amazon MSK](limits.md#msk-provisioned-quota) para los corredores Standard. | 