기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.
Amazon MSK 프로비저닝 클러스터에 권장되는 CloudWatch 경보
Amazon MSK 프로비저닝된 클러스터를 모니터링하여 애플리케이션에 영향을 미치기 전에 문제를 감지합니다. CloudWatch 경보는 CloudWatch 지표가 일정 시간 동안 지정된 값을 초과하면 조치를 수행합니다. 예를 들어 파티션 수가 브로커 인스턴스 크기의 권장 값을 15분 이상 초과하는 경우 이메일 알림을 받을 수 있습니다. 다음 표의 중요 경보는 권장되지만 클러스터를 모니터링하기 위해 생성할 수 있는 경보의 전체 목록은 아닙니다.
경보 구성에 대한 자세한 내용은 Amazon CloudWatch 사용 설명서의 Amazon CloudWatch 경보 생성을 참조하세요. Amazon CloudWatch
다음 표에는 Standard 브로커와 Express 브로커 모두에 적용되는 경보가 나열되어 있습니다.
| 경보 | 문제 |
|---|---|
|
Dimensions: |
하나 이상의 브로커에 평균 CPUUser+CPUSystem이 권장 60%를 초과합니다. 자세한 내용은 CPU 사용량 모니터링를 참조하세요. |
|
Dimensions: |
하나 이상의 브로커에 권장 파티션 수 제한보다 높은 파티션이 있습니다. 자세한 내용은 클러스터 크기를 적절하게 조정: Standard 브로커당 파티션 수 및 Express 브로커 파티션 할당량 섹션을 참조하세요. |
|
차원: |
주제의 모든 파티션에 대한 집계된 오프셋 지연은 X를 초과합니다. 지연에 대한 자세한 내용은 각 파티션의 지연을 나타내는 파티션 수준 |
다음 표에는 표준 브로커에만 적용되는 경보가 나열되어 있습니다.
| 경보 | 문제 |
|---|---|
|
차원: |
하나 이상의 주제 파티션을 사용할 수 없습니다. 파티션을 사용할 수 없는 경우 해당 파티션에 대한 생산 및 소비 작업이 실패합니다. 오프라인 파티션은 균형 잡힌 올바른 크기 및 올바르게 구성된 클러스터에서 발생해서는 안 됩니다. 자세한 내용은 고가용성 클러스터 빌드를 참조하세요. |
|
Dimensions: |
하나 이상의 주제에 최소 구성된 동기화 내 복제본 세트(ISR) 아래에 파티션이 있습니다. 파티션이 최소 ISR 아래로 떨어지면 생산 작업이 실패합니다(생산자 사용 |
|
Dimensions: |
하나 이상의 브로커에 80% 이상의 데이터 디스크 사용량이 있습니다. 자세한 내용은 디스크 공간 모니터링를 참조하세요. |
|
Dimensions: |
하나 이상의 브로커에 가비지 수집 후 사용 중인 총 힙 메모리의 60% 이상이 있습니다. 자세한 내용은 Apache Kafka 메모리 모니터링를 참조하세요. |
|
(합계( Dimensions: |
하나 이상의 브로커에 사용 가능한 볼륨 처리량의 최대 80%를 사용하는 기본 볼륨 읽기 및 쓰기 활동이 있습니다. 자세한 내용은 프로비저닝된 스토리지 처리량을 참조하세요. |
|
Dimensions: |
이는 t3.small 브로커 유형과만 관련이 있습니다. 하나 이상의 브로커가 최대 576개에서 100개 미만으로 CPU 크레딧 밸런스를 소진했습니다. 잔고가 0에 도달하면 브로커가 20% CPU 기준을 초과할 수 없습니다. CPU 크레딧 고갈을 방지하려면 t3 브로커 인스턴스 유형에서 CPU 크레딧을 사용하지 않는 m7g 인스턴스 유형으로 업그레이드하세요. |
|
Dimensions: |
하나 이상의 브로커가 요청 처리를 담당하는 스레드풀에서 활동 정체를 보고 있습니다(스레드풀이 30% 미만 유휴 상태). 여기의 포화도는 느린 요청을 나타내며, 이로 인해 클라이언트 측 제한 시간이 발생할 수 있습니다. 또한 클라이언트가 과도한 요청을 생성하는지 검토합니다. 예를 들어 권한이 없는 클라이언트는 브로커가 거부하는 요청을 적극적으로 재시도할 수 있습니다. 클러스터 처리량 최적화에 대한 자세한 내용은 섹션을 참조하세요m5.4xl, m7g.4xl 또는 더 큰 인스턴스에 대한 클러스터 처리량 최적화. |
|
Dimensions: |
하나 이상의 브로커가 네트워크 연결 스레드풀에서 활동 정체를 보고 있습니다(스레드풀이 30% 미만 유휴 상태). 여기에서 포화하면 시간 초과가 발생할 수 있습니다. 또한 클라이언트가 과도한 요청을 생성하는지 검토합니다. 예를 들어 권한이 없는 클라이언트는 브로커가 거부하는 요청을 적극적으로 재시도할 수 있습니다. 클러스터 처리량 최적화에 대한 자세한 내용은 섹션을 참조하세요m5.4xl, m7g.4xl 또는 더 큰 인스턴스에 대한 클러스터 처리량 최적화. |
|
Dimensions: |
브로커에서 사용 중인 파일 설명자의 백분율입니다. 100% 소진 시 Kafka 브로커를 시작하지 못할 수 있습니다. 파일 설명자 수는 파티션 수, 각 파티션의 로그 세그먼트 수, 클라이언트 연결 수에 따라 증가합니다. |
|
Dimensions: |
브로커에서 사용 중인 메모리 매핑 파일의 백분율입니다. 100% 소진 시 Kafka 브로커를 시작하지 못할 수 있습니다. 메모리 매핑 파일 사용량은 파티션 수와 각 파티션의 로그 세그먼트 수에 따라 증가합니다. |
IAM 액세스 제어 경보
위의 경보 외에도 IAM 액세스 제어와 관련된 다음 지표에 대한 경보를 생성하는 것이 좋습니다. 이러한 경보는 IAM 인증이 활성화된 Standard 브로커와 Express 브로커 모두에 적용됩니다. Amazon MSK는 IAM 연결 요청 오버로드로부터 브로커를 보호하기 위해 IAM 연결에 논리적 제한을 둡니다. 이러한 제한을 위반하면 클라이언트 연결 제한 시간이 초과되어 워크로드에 영향을 미칩니다.
| 경보 | 문제 |
|---|---|
|
차원: |
하나 이상의 브로커에 연결 한도의 80%와 동일한 연결 수가 있습니다. IAM 액세스 제어를 위한 브로커당 기본 최대 TCP 연결 수는 3000입니다. 이 값은 변경할 수 없습니다. 자세한 내용은 Express 브로커Amazon MSK Express 브로커 할당량의 경우 섹션을 참조하고 표준 브로커의 Amazon MSK Standard 브로커 할당량 경우 섹션을 참조하세요. |
|
Dimensions: |
하나 이상의 브로커에 클라이언트가 연결 생성 속도 제한의 80%에 해당하는 속도로 IAM 연결을 생성합니다. IAM 액세스 제어를 위한 브로커당 최대 TCP 연결 속도는 인스턴스 크기에 따라 다릅니다. 자세한 내용은 Express 브로커Amazon MSK Express 브로커 할당량의 경우 섹션을 참조하고 표준 브로커의 Amazon MSK Standard 브로커 할당량 경우 섹션을 참조하세요. |