View a markdown version of this page

CloudWatch Alarmes recomendados para clusters provisionados pelo Amazon MSK - Amazon Managed Streaming for Apache Kafka

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

CloudWatch Alarmes recomendados para clusters provisionados pelo Amazon MSK

Monitore seus clusters provisionados pelo Amazon MSK para detectar problemas antes que eles afetem seus aplicativos. CloudWatch os alarmes realizam uma ação quando uma CloudWatch métrica excede um valor especificado por algum tempo. Por exemplo, talvez você queira receber uma notificação por e-mail se sua contagem de partições exceder o valor recomendado para o tamanho da instância do seu broker por mais de 15 minutos. Os alarmes críticos na tabela a seguir são recomendados, mas não são uma lista completa de alarmes que você pode criar para monitorar seu cluster.

Para obter mais informações sobre a configuração de alarmes, consulte Criação de CloudWatch alarmes da Amazon no Guia do usuário da Amazon CloudWatch .

A tabela a seguir lista os alarmes que se aplicam aos corretores Standard e Express.

Alarme Problema

CPUUser+ CPUSystem Média >= 60 por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Um ou mais corretores têm uma média de CPUUser+CPUsystem acima dos 60% recomendados. Para saber mais, consulte Monitorar uso da CPU.

PartitionCountMédia >= X por 5 minutos, 3 vezes consecutivas (X = Contagem de partições recomendada para o tamanho da instância do broker)

Dimensões: Cluster Name, Broker ID

Um ou mais corretores têm partições acima do limite recomendado de contagem de partições. Para saber mais, consulte Right-size seu cluster: Número de partições por corretor padrão e Cota de partição do agente Express.

SumOffsetLagMédia >= X por 5 minutos, 3 vezes consecutivas (X é definido para um grupo de consumidores e combinação de tópicos com base no caso de uso)

Dimensões: Cluster Name, Consumer Group, Topic

O atraso de deslocamento agregado para todas as partições em um tópico é maior que X. Para obter mais informações sobre o atraso, você pode usar a Offset métrica de nível de partição, que representa o atraso de cada partição, ou usar a ferramenta de linha de comando Kafka para descrever o grupo de consumidores. Analise a velocidade de processamento de sua solicitação de consumidor em relação aos produtores para entender se os consumidores não conseguem acompanhar o ritmo e verifique se algum reequilíbrio do consumidor está atrasando os consumidores.

A tabela a seguir lista os alarmes que se aplicam somente aos corretores padrão.

Alarme Problema

OfflinePartitionsCountMédia >= 1 por 1 minuto, 3 vezes consecutivas

Dimensões: Cluster Name

Uma ou mais partições de tópicos não estão disponíveis. Quando as partições não estão disponíveis, as operações de produção e consumo dessas partições falham. As partições off-line não devem ocorrer em um cluster bem balanceado, dimensionado e configurado corretamente. Para saber mais, consulte Criar clusters altamente disponíveis.

UnderMinIsrPartitionCountMédia >= 1 por 1 minuto, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Um ou mais tópicos têm partições abaixo do conjunto mínimo de réplicas em sincronização (ISR) configurado. Quando as partições ficam abaixo do ISR mínimo, as operações de produção falham (com o produtoracks=all). Para saber mais, consulte Criar clusters altamente disponíveis.

KafkaDataLogsDiskUsedMédia >= 80 por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Um ou mais corretores têm um uso de disco de dados de 80% ou mais. Para saber mais, consulte Monitorar o espaço em disco.

HeapMemoryAfterGCMédia >= 60 por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Um ou mais corretores têm 60% ou mais do total de memória de pilha em uso após a coleta de lixo. Para saber mais, consulte Monitorar a memória do Apache Kafka.

(Sum (VolumeReadBytes) + Sum (VolumeWriteBytes))/(5 * 60 * 1024 * 1024) >= X MiB por 5 minutos, 3 vezes consecutivas (X = 80% da taxa de transferência de volume disponível)

Dimensões: Cluster Name, Broker ID

Um ou mais corretores têm atividade subjacente de leitura e gravação de volume usando até 80% de sua taxa de transferência de volume disponível. Para saber mais, consulte Taxa de transferência de armazenamento provisionado.

CPUCreditBalanceMédia <= 100 por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Isso só é relevante para o tipo de corretor t3.small. Um ou mais corretores esgotaram seu saldo de crédito de CPU de um máximo de 576 para menos de 100. Quando o saldo atinge 0, o corretor não pode exceder a linha de base de 20% da CPU. Para evitar o esgotamento do crédito da CPU, faça o upgrade de um tipo de instância t3 broker para um tipo de instância m7g, que não usa créditos de CPU.

RequestHandlerAvgIdlePercentMédia <= 0,3 por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Um ou mais corretores estão vendo congestionamento de atividades no threadpool responsável por atender às solicitações (o threadpool está inativo em menos de 30%). A saturação aqui indica solicitações lentas, o que pode causar tempos limite do lado do cliente. Além disso, analise se seus clientes estão gerando solicitações excessivas. Por exemplo, clientes não autorizados podem estar repetindo agressivamente as solicitações que os corretores estão negando. Para saber mais sobre como otimizar a taxa de transferência do cluster, consulte. Otimizar o throughput do cluster para instâncias m5.4xl, m7g.4xl ou maiores

NetworkProcessorAvgIdlePercentMédia <= 0,3 por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

Um ou mais corretores estão vendo congestionamento de atividades no threadpool de conexão de rede (o threadpool está inativo em menos de 30%). A saturação aqui pode causar tempos limite. Além disso, analise se seus clientes estão gerando solicitações excessivas. Por exemplo, clientes não autorizados podem estar repetindo agressivamente solicitações que os corretores estão negando. Para saber mais sobre como otimizar a taxa de transferência do cluster, consulte. Otimizar o throughput do cluster para instâncias m5.4xl, m7g.4xl ou maiores

KafkaFileDescriptorsUsagePercent> 80% por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

A porcentagem de descritores de arquivo em uso no broker. Com 100% de exaustão, o corretor Kafka pode não conseguir começar. A contagem de descritores de arquivo aumenta com o número de partições, o número de segmentos de log em cada partição e o número de conexões do cliente. Analise se você tem tópicos com segment.ms valores baixos que resultam em frequentes rolagens de registros e considere reduzir o número de conexões de clientes.

KafkaMemoryMappedFilesUsagePercent> 80% por 5 minutos, 3 vezes consecutivas

Dimensões: Cluster Name, Broker ID

A porcentagem de arquivos mapeados na memória em uso no broker. Com 100% de exaustão, o corretor Kafka pode não conseguir começar. A contagem de uso de arquivos mapeados na memória aumenta com o número de partições e o número de segmentos de log em cada partição. Verifique se você tem tópicos com segment.ms valores baixos que resultam em rolagens de registros frequentes.

Alarmes de controle de acesso IAM

Além dos alarmes anteriores, recomendamos criar alarmes para as seguintes métricas específicas do controle de acesso do IAM. Esses alarmes se aplicam aos corretores Standard e Express com a autenticação IAM ativada. O Amazon MSK impõe limites lógicos às conexões do IAM para proteger o broker da sobrecarga de solicitações de conexão do IAM. A violação de qualquer um desses limites resulta em tempos limite de conexão do cliente, o que afetará sua carga de trabalho.

Alarme Problema

ClientConnectionCountSoma >= X por 1 minuto, 3 vezes consecutivas (X = 80% do máximo de conexões TCP por broker)

Dimensões: Cluster Name, Broker ID, Client Authentication

Um ou mais corretores têm uma contagem de conexões igual a 80% do limite de conexão. O máximo padrão de conexões TCP por agente para controle de acesso do IAM é 3000. Este valor pode ser alterado. Para obter mais informações, consulte Cota de agentes Express do Amazon MSK para corretores Express e Cota de agente Standard do Amazon MSK para corretores Standard.

ConnectionCreationRateSoma >= X por 1 minuto, 3 vezes consecutivas (X = 80% do limite da taxa de criação de conexão para o tamanho da sua instância)

Dimensões: Cluster Name, Broker ID

Um ou mais corretores têm clientes criando conexões IAM a uma taxa igual a 80% de seu limite de taxa de criação de conexões. A taxa máxima de conexões TCP por agente para controle de acesso do IAM depende do tamanho da instância. Para obter mais informações, consulte Cota de agentes Express do Amazon MSK para corretores Express e Cota de agente Standard do Amazon MSK para corretores Standard.