View a markdown version of this page

CloudWatch Allarmi consigliati per i cluster Amazon MSK Provisioned - Amazon Managed Streaming per Apache Kafka

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

CloudWatch Allarmi consigliati per i cluster Amazon MSK Provisioned

Monitora i tuoi cluster Amazon MSK Provisioned per rilevare i problemi prima che influiscano sulle tue applicazioni. CloudWatch gli allarmi eseguono un'azione quando una CloudWatch metrica supera un valore specificato per un certo periodo di tempo. Ad esempio, potresti voler ricevere una notifica via email se il numero delle partizioni supera il valore consigliato per la dimensione dell'istanza del broker per più di 15 minuti. Gli allarmi critici riportati nella tabella seguente sono consigliati, ma non sono un elenco esaustivo di allarmi che è possibile creare per monitorare il cluster.

Per ulteriori informazioni sulla configurazione degli allarmi, consulta Creating Amazon CloudWatch alarms nella Amazon User Guide. CloudWatch

La tabella seguente elenca gli allarmi che si applicano ai broker Standard ed Express.

Allarme Problema

CPUUser+ CPUSystem Media >= 60 per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

Uno o più broker hanno una media di utente+CPU del sistema CPU superiore al 60% consigliato. Per ulteriori informazioni, consulta Monitoraggio dell'utilizzo della CPU.

PartitionCountMedia >= X per 5 minuti, 3 volte consecutive (X = numero di partizioni consigliato per la dimensione dell'istanza del broker)

Dimensioni: Cluster Name, Broker ID

Uno o più broker hanno partizioni superiori al limite di numero di partizioni consigliato. Per ulteriori informazioni, consultare Right-size il tuo cluster: numero di partizioni per broker Standard e Quota di partizione di Express Broker.

SumOffsetLagMedia >= X per 5 minuti, 3 volte consecutive (X è impostato per un gruppo di consumatori e una combinazione di argomenti in base al caso d'uso)

Dimensioni: Cluster Name, Consumer Group, Topic

Il ritardo di offset aggregato per tutte le partizioni in un argomento è superiore a X Per ulteriori informazioni sul ritardo, è possibile utilizzare la Offset metrica a livello di partizione, che rappresenta il ritardo per ogni partizione, oppure utilizzare lo strumento a riga di comando Kafka per descrivere il gruppo di consumatori. Esamina la velocità di elaborazione della tua applicazione consumer rispetto ai produttori per capire se i consumatori non sono in grado di tenere il passo e controlla se eventuali ribilanciamenti dei consumatori stanno rallentando i consumatori.

La tabella seguente elenca gli allarmi che si applicano solo ai broker Standard.

Allarme Problema

OfflinePartitionsCountMedia >= 1 per 1 minuto, 3 volte consecutive

Dimensioni: Cluster Name

Una o più partizioni tematiche non sono disponibili. Quando le partizioni non sono disponibili, le operazioni di produzione e consumo su tali partizioni hanno esito negativo. Le partizioni offline non dovrebbero verificarsi su un cluster ben bilanciato, correttamente dimensionato e configurato correttamente. Per ulteriori informazioni, consulta Creazione di cluster a disponibilità elevata.

UnderMinIsrPartitionCountMedia >= 1 per 1 minuto, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

In uno o più argomenti le partizioni rientrano nel set di replica sincronizzato minimo (ISR) configurato. Quando le partizioni scendono al di sotto dell'ISR minimo, le operazioni di produzione hanno esito negativo (con producer). acks=all Per ulteriori informazioni, consulta Creazione di cluster a disponibilità elevata.

KafkaDataLogsDiskUsedMedia >= 80 per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

Uno o più broker hanno un utilizzo del disco dati pari o superiore all'80%. Per ulteriori informazioni, consulta Monitoraggio dello spazio su disco.

HeapMemoryAfterGCMedia >= 60 per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

Uno o più broker utilizzano il 60% o più della memoria heap totale dopo la garbage collection. Per ulteriori informazioni, consulta Monitoraggio della memoria di Apache Kafka.

(Sum (VolumeReadBytes) + Sum (VolumeWriteBytes))/(5 * 60 * 1024 * 1024) >= X MiB per 5 minuti, 3 volte consecutive (X = 80% del throughput di volume disponibile)

Dimensioni: Cluster Name, Broker ID

Uno o più broker hanno un'attività di lettura e scrittura di volume sottostante che utilizza fino all'80% del throughput di volume disponibile. Per ulteriori informazioni, consulta Provisioned storage throughput.

CPUCreditBalanceMedia <= 100 per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

Questo è rilevante solo per il tipo di broker t3.small. Uno o più broker hanno ridotto il saldo dei crediti della CPU da un massimo di 576 a meno di 100. Quando il saldo raggiunge lo 0, il broker non può superare la soglia di base della CPU del 20%. Per evitare l'esaurimento del credito della CPU, esegui l'upgrade da un tipo di istanza del broker t3 a un tipo di istanza m7g, che non utilizza i crediti della CPU.

RequestHandlerAvgIdlePercentMedia <= 0,3 per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

Uno o più broker riscontrano una congestione delle attività nel threadpool responsabile della gestione delle richieste (il threadpool è inattivo per meno del 30%). La saturazione in questo caso indica richieste lente, che possono causare timeout sul lato client. Inoltre, verifica se i tuoi clienti stanno generando richieste eccessive. Ad esempio, i clienti non autorizzati potrebbero ritentare in modo aggressivo le richieste che i broker stanno negando. Per saperne di più sull'ottimizzazione del throughput del cluster, consulta. Ottimizza il throughput del cluster per istanze m5.4xl, m7g.4xl o superiori

NetworkProcessorAvgIdlePercentMedia <= 0,3 per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

Uno o più broker riscontrano una congestione delle attività sul threadpool di connessione di rete (il threadpool è inattivo per meno del 30%). La saturazione in questo caso può causare dei timeout. Inoltre, verifica se i tuoi clienti stanno generando richieste eccessive. Ad esempio, i clienti non autorizzati potrebbero ritentare in modo aggressivo le richieste che i broker stanno negando. Per saperne di più sull'ottimizzazione del throughput del cluster, consulta. Ottimizza il throughput del cluster per istanze m5.4xl, m7g.4xl o superiori

KafkaFileDescriptorsUsagePercent> 80% per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

La percentuale di descrittori di file utilizzati sul broker. Al 100% di esaurimento, il broker Kafka potrebbe non essere in grado di avviarsi. Il numero dei descrittori di file aumenta con il numero di partizioni, il numero di segmenti di registro in ciascuna partizione e il numero di connessioni client. Verifica se sono presenti argomenti con segment.ms valori bassi che comportano la frequenza dei registri e valuta la possibilità di ridurre il numero di connessioni client.

KafkaMemoryMappedFilesUsagePercent> 80% per 5 minuti, 3 volte consecutive

Dimensioni: Cluster Name, Broker ID

La percentuale di file mappati in memoria in uso sul broker. Al 100% di esaurimento, il broker Kafka potrebbe non essere in grado di avviarsi. Il conteggio dell'utilizzo dei file mappati in memoria aumenta con il numero di partizioni e il numero di segmenti di registro in ciascuna partizione. Verifica se sono presenti argomenti con segment.ms valori bassi che comportano la frequenza dei registri.

Allarmi per il controllo degli accessi IAM

Oltre agli allarmi precedenti, consigliamo di creare allarmi per le seguenti metriche specifiche del controllo degli accessi IAM. Questi allarmi si applicano ai broker Standard ed Express con l'autenticazione IAM abilitata. Amazon MSK impone limiti logici alle connessioni IAM per proteggere il broker dal sovraccarico delle richieste di connessione IAM. La violazione di uno di questi limiti comporta dei timeout della connessione del client, che influiranno sul carico di lavoro.

Allarme Problema

ClientConnectionCountSomma >= X per 1 minuto, 3 volte consecutive (X = 80% del numero massimo di connessioni TCP per broker)

Dimensioni: Cluster Name, Broker ID, Client Authentication

Uno o più broker hanno un numero di connessioni pari all'80% del limite di connessione. Il numero massimo di connessioni TCP predefinito per broker per il controllo degli accessi IAM è 3000. Questo valore può essere modificato. Per ulteriori informazioni, consulta Quota di broker Amazon MSK Express la sezione dedicata ai broker Express e Quota di broker Amazon MSK Standard ai broker Standard.

ConnectionCreationRateSomma >= X per 1 minuto, 3 volte consecutive (X = 80% del limite di velocità di creazione della connessione per le dimensioni dell'istanza)

Dimensioni: Cluster Name, Broker ID

Uno o più broker hanno clienti che creano connessioni IAM a una velocità pari all'80% del limite di velocità di creazione delle connessioni. La velocità massima di connessioni TCP per broker per il controllo degli accessi IAM dipende dalla dimensione dell'istanza. Per ulteriori informazioni, consulta Quota di broker Amazon MSK Express la sezione dedicata ai broker Express e Quota di broker Amazon MSK Standard ai broker Standard.