View a markdown version of this page

Amazon MSK 프로비저닝 클러스터에 권장되는 CloudWatch 경보 - Amazon Managed Streaming for Apache Kafka

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

Amazon MSK 프로비저닝 클러스터에 권장되는 CloudWatch 경보

Amazon MSK 프로비저닝된 클러스터를 모니터링하여 애플리케이션에 영향을 미치기 전에 문제를 감지합니다. CloudWatch 경보는 CloudWatch 지표가 일정 시간 동안 지정된 값을 초과하면 조치를 수행합니다. 예를 들어 파티션 수가 브로커 인스턴스 크기의 권장 값을 15분 이상 초과하는 경우 이메일 알림을 받을 수 있습니다. 다음 표의 중요 경보는 권장되지만 클러스터를 모니터링하기 위해 생성할 수 있는 경보의 전체 목록은 아닙니다.

경보 구성에 대한 자세한 내용은 Amazon CloudWatch 사용 설명서의 Amazon CloudWatch 경보 생성을 참조하세요. Amazon CloudWatch

다음 표에는 Standard 브로커와 Express 브로커 모두에 적용되는 경보가 나열되어 있습니다.

경보 문제

CPUUser + CPUSystem 평균 >= 5분 동안 60, 연속 횟수 3회

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커에 평균 CPUUser+CPUSystem이 권장 60%를 초과합니다. 자세한 내용은 CPU 사용량 모니터링를 참조하세요.

PartitionCount 5분 동안 평균 >= X, 연속 3회(X = 브로커 인스턴스 크기에 대한 권장 파티션 수)

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커에 권장 파티션 수 제한보다 높은 파티션이 있습니다. 자세한 내용은 클러스터 크기를 적절하게 조정: Standard 브로커당 파티션 수 및 Express 브로커 파티션 할당량 섹션을 참조하세요.

SumOffsetLag 5분 동안 평균 >= X, 연속 3회(사용 사례에 따라 소비자 그룹 및 주제 조합에 대해 X가 설정됨)

차원: Cluster Name, Consumer Group, Topic

주제의 모든 파티션에 대한 집계된 오프셋 지연은 X를 초과합니다. 지연에 대한 자세한 내용은 각 파티션의 지연을 나타내는 파티션 수준 Offset 지표를 사용하거나 Kafka 명령줄 도구를 사용하여 소비자 그룹을 설명할 수 있습니다. 생산자와 관련된 소비자 애플리케이션의 처리 속도를 검토하여 소비자가 따라잡을 수 없는지 확인하고 소비자 리밸런싱으로 인해 소비자 속도가 느려지는지 확인합니다.

다음 표에는 표준 브로커에만 적용되는 경보가 나열되어 있습니다.

경보 문제

OfflinePartitionsCount 1분 동안 평균 >= 1, 연속 횟수 3회

차원: Cluster Name

하나 이상의 주제 파티션을 사용할 수 없습니다. 파티션을 사용할 수 없는 경우 해당 파티션에 대한 생산 및 소비 작업이 실패합니다. 오프라인 파티션은 균형 잡힌 올바른 크기 및 올바르게 구성된 클러스터에서 발생해서는 안 됩니다. 자세한 내용은 고가용성 클러스터 빌드를 참조하세요.

UnderMinIsrPartitionCount 1분 동안 평균 >= 1, 연속 횟수 3회

Dimensions: Cluster Name, Broker ID

하나 이상의 주제에 최소 구성된 동기화 내 복제본 세트(ISR) 아래에 파티션이 있습니다. 파티션이 최소 ISR 아래로 떨어지면 생산 작업이 실패합니다(생산자 사용acks=all). 자세한 내용은 고가용성 클러스터 빌드를 참조하세요.

KafkaDataLogsDiskUsed 5분 동안 평균 >= 80, 연속 횟수 3회

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커에 80% 이상의 데이터 디스크 사용량이 있습니다. 자세한 내용은 디스크 공간 모니터링를 참조하세요.

HeapMemoryAfterGC 5분 동안 평균 >= 60, 연속 횟수 3회

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커에 가비지 수집 후 사용 중인 총 힙 메모리의 60% 이상이 있습니다. 자세한 내용은 Apache Kafka 메모리 모니터링를 참조하세요.

(합계(VolumeReadBytes) + 합계(VolumeWriteBytes)) / (5 * 60 * 1024 * 1024) >= 5분 동안 X MiB, 연속 3회(사용 가능한 볼륨 처리량의 X = 80%)

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커에 사용 가능한 볼륨 처리량의 최대 80%를 사용하는 기본 볼륨 읽기 및 쓰기 활동이 있습니다. 자세한 내용은 프로비저닝된 스토리지 처리량을 참조하세요.

CPUCreditBalance 평균 <= 100, 5분, 연속 3회

Dimensions: Cluster Name, Broker ID

이는 t3.small 브로커 유형과만 관련이 있습니다. 하나 이상의 브로커가 최대 576개에서 100개 미만으로 CPU 크레딧 밸런스를 소진했습니다. 잔고가 0에 도달하면 브로커가 20% CPU 기준을 초과할 수 없습니다. CPU 크레딧 고갈을 방지하려면 t3 브로커 인스턴스 유형에서 CPU 크레딧을 사용하지 않는 m7g 인스턴스 유형으로 업그레이드하세요.

RequestHandlerAvgIdlePercent 평균 <= 0.3, 5분, 연속 3회

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커가 요청 처리를 담당하는 스레드풀에서 활동 정체를 보고 있습니다(스레드풀이 30% 미만 유휴 상태). 여기의 포화도는 느린 요청을 나타내며, 이로 인해 클라이언트 측 제한 시간이 발생할 수 있습니다. 또한 클라이언트가 과도한 요청을 생성하는지 검토합니다. 예를 들어 권한이 없는 클라이언트는 브로커가 거부하는 요청을 적극적으로 재시도할 수 있습니다. 클러스터 처리량 최적화에 대한 자세한 내용은 섹션을 참조하세요m5.4xl, m7g.4xl 또는 더 큰 인스턴스에 대한 클러스터 처리량 최적화.

NetworkProcessorAvgIdlePercent 평균 <= 0.3, 5분, 연속 3회

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커가 네트워크 연결 스레드풀에서 활동 정체를 보고 있습니다(스레드풀이 30% 미만 유휴 상태). 여기에서 포화하면 시간 초과가 발생할 수 있습니다. 또한 클라이언트가 과도한 요청을 생성하는지 검토합니다. 예를 들어 권한이 없는 클라이언트는 브로커가 거부하는 요청을 적극적으로 재시도할 수 있습니다. 클러스터 처리량 최적화에 대한 자세한 내용은 섹션을 참조하세요m5.4xl, m7g.4xl 또는 더 큰 인스턴스에 대한 클러스터 처리량 최적화.

KafkaFileDescriptorsUsagePercent 5분 동안 > 80%, 연속 3회

Dimensions: Cluster Name, Broker ID

브로커에서 사용 중인 파일 설명자의 백분율입니다. 100% 소진 시 Kafka 브로커를 시작하지 못할 수 있습니다. 파일 설명자 수는 파티션 수, 각 파티션의 로그 세그먼트 수, 클라이언트 연결 수에 따라 증가합니다. segment.ms 값이 낮아 로그 롤이 자주 발생하는 주제가 있는지 검토하고 클라이언트 연결 수를 줄이는 것이 좋습니다.

KafkaMemoryMappedFilesUsagePercent 5분 동안 > 80%, 연속 3회

Dimensions: Cluster Name, Broker ID

브로커에서 사용 중인 메모리 매핑 파일의 백분율입니다. 100% 소진 시 Kafka 브로커를 시작하지 못할 수 있습니다. 메모리 매핑 파일 사용량은 파티션 수와 각 파티션의 로그 세그먼트 수에 따라 증가합니다. segment.ms 값이 낮아 로그 롤이 자주 발생하는 주제가 있는지 검토합니다.

IAM 액세스 제어 경보

위의 경보 외에도 IAM 액세스 제어와 관련된 다음 지표에 대한 경보를 생성하는 것이 좋습니다. 이러한 경보는 IAM 인증이 활성화된 Standard 브로커와 Express 브로커 모두에 적용됩니다. Amazon MSK는 IAM 연결 요청 오버로드로부터 브로커를 보호하기 위해 IAM 연결에 논리적 제한을 둡니다. 이러한 제한을 위반하면 클라이언트 연결 제한 시간이 초과되어 워크로드에 영향을 미칩니다.

경보 문제

ClientConnectionCount 합계 1분 동안 >= X, 연속 3회(X = 브로커당 최대 TCP 연결 수의 80%)

차원: Cluster Name, Broker ID, Client Authentication

하나 이상의 브로커에 연결 한도의 80%와 동일한 연결 수가 있습니다. IAM 액세스 제어를 위한 브로커당 기본 최대 TCP 연결 수는 3000입니다. 이 값은 변경할 수 없습니다. 자세한 내용은 Express 브로커Amazon MSK Express 브로커 할당량의 경우 섹션을 참조하고 표준 브로커의 Amazon MSK Standard 브로커 할당량 경우 섹션을 참조하세요.

ConnectionCreationRate 합계 1분 동안 >= X, 연속 3회(X = 인스턴스 크기에 대한 연결 생성 속도 제한의 80%)

Dimensions: Cluster Name, Broker ID

하나 이상의 브로커에 클라이언트가 연결 생성 속도 제한의 80%에 해당하는 속도로 IAM 연결을 생성합니다. IAM 액세스 제어를 위한 브로커당 최대 TCP 연결 속도는 인스턴스 크기에 따라 다릅니다. 자세한 내용은 Express 브로커Amazon MSK Express 브로커 할당량의 경우 섹션을 참조하고 표준 브로커의 Amazon MSK Standard 브로커 할당량 경우 섹션을 참조하세요.