

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

# Alarm PromQL yang direkomendasikan
<a name="Recommended_PromQL_Alarms"></a>

Gunakan alarm PromQL ini sebagai setara dengan alarm klasik yang direkomendasikan. Mereka memantau metrik yang sama dengan menggunakan kueri instan PromQL yang dievaluasi terhadap metrik yang dicerna melalui titik akhir CloudWatch OTLP.

Alarm PromQL digunakan `EvaluationCriteria` dengan. `PromQLCriteria` Tidak seperti alarm metrik klasik, ambang batas disematkan langsung dalam ekspresi kueri PromQL.
+ **Periode tertunda ** — Durasi dalam detik yang harus terus dilanggar oleh rangkaian waktu sebelum alarm beralih ke status ALARM.
+ **Periode pemulihan ** — Durasi dalam detik yang semua deret waktu harus berhenti melanggar sebelum alarm kembali ke keadaan OK.
+ **Interval evaluasi ** — Seberapa sering, dalam hitungan detik, CloudWatch menjalankan kueri PromQL.

**catatan**  
Alarm ini memerlukan metrik yang dipublikasikan melalui titik akhir CloudWatch OTLP. Untuk informasi selengkapnya, lihat [Alarm PromQL](alarm-promql.md).

Anda dapat menerapkan alarm ini dengan menggunakan AWS CloudFormation. Gunakan `PromQLCriteria` properti `EvaluationCriteria` dan pada `AWS::CloudWatch::Alarm` sumber daya.

**Topics**
+ [API Gateway](#Recommended_PromQL_ApiGateway)
+ [Auto Scaling](#Recommended_PromQL_AutoScaling)
+ [Manajer Sertifikat](#Recommended_PromQL_CertificateManager)
+ [CloudFront](#Recommended_PromQL_CloudFront)
+ [Cognito](#Recommended_PromQL_Cognito)
+ [DynamoDB](#Recommended_PromQL_DynamoDB)
+ [EBS](#Recommended_PromQL_EBS)
+ [Amazon Elastic Compute Cloud](#Recommended_PromQL_EC2)
+ [Amazon ECS](#Recommended_PromQL_ECS)
+ [Wawasan Kontainer Amazon ECS](#Recommended_PromQL_ECS_ContainerInsights)
+ [Amazon ECS Container Insights meningkatkan pengamatan](#Recommended_PromQL_ECS_ContainerInsights_Enhanced)
+ [Amazon EFS](#Recommended_PromQL_EFS)
+ [Wawasan Kontainer Amazon EKS](#Recommended_PromQL_EKS)
+ [Amazon ElastiCache](#Recommended_PromQL_ElastiCache)
+ [GPU elastis](#Recommended_PromQL_ElasticGPUs)
+ [Pen EventBridge jadwal Amazon](#Recommended_PromQL_Scheduler)
+ [Amazon Kinesis Data Streams](#Recommended_PromQL_Kinesis)
+ [AWS Lambda](#Recommended_PromQL_Lambda)
+ [AWS Lambda Wawasan](#Recommended_PromQL_LambdaInsights)
+ [Gerbang NAT](#Recommended_PromQL_NATGateway)
+ [AWS PrivateLink titik akhir](#Recommended_PromQL_PrivateLinkEndpoints)
+ [AWS PrivateLink layanan](#Recommended_PromQL_PrivateLinkServices)
+ [RDS](#Recommended_PromQL_RDS)
+ [Route 53](#Recommended_PromQL_Route53)
+ [S3](#Recommended_PromQL_S3)
+ [S3 Object Lambda](#Recommended_PromQL_S3ObjectLambda)
+ [SNS](#Recommended_PromQL_SNS)
+ [SQS](#Recommended_PromQL_SQS)
+ [VPN](#Recommended_PromQL_VPN)

## API Gateway
<a name="Recommended_PromQL_ApiGateway"></a>

**API REST **

**4XXError**  
**Label: **ApiName, Panggung  
**Deskripsi alarm: ** Alarm saat tingkat kesalahan 4XX rata-rata melebihi 5% untuk tahap REST API.  
**Maksud: ** Mendeteksi tingkat kesalahan klien yang tinggi yang menunjukkan masalah permintaan.  
**Kriteria PromQL: ** `avg({__name__="4XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Men ** deteksi tingkat kesalahan klien yang lebih besar dari 5%, yang menunjukkan kegagalan permintaan yang signifikan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**5XXError**  
**Label: **ApiName, Panggung  
**Deskripsi alarm: ** Alarm saat tingkat kesalahan 5XX rata-rata melebihi 5% untuk tahap REST API.  
**Maksud: ** Mendeteksi tingkat kesalahan server tinggi yang menunjukkan kegagalan backend.  
**Kriteria PromQL: ** `avg({__name__="5XXError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Men ** deteksi tingkat kesalahan server lebih besar dari 5%, yang memerlukan penyelidikan segera.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 300

**Latensi**  
**Label: **ApiName, Panggung  
**Deskripsi alarm: ** Alarm saat latensi p90 melebihi 2500 ms untuk tahap REST API.  
**Maksud: ** Mendeteksi latensi p90 tinggi yang memengaruhi pengalaman pengguna.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) > 2500`  
**Ambang batas yang disarankan: ** 2500 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Latensi p90 di atas 2500 ms menunjukkan waktu respons yang menurun untuk sebagian besar permintaan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**Hitungan**  
**Label: **ApiName, Panggung  
**Deskripsi alarm: ** Alarm saat jumlah permintaan total turun di bawah baseline yang diharapkan untuk tahap REST API.  
**Maksud: ** Mendeteksi volume lalu lintas rendah yang mungkin mengindikasikan masalah routing atau ketersediaan.  
**Kriteria PromQL: ** `sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiName="{{your-api-name}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan garis dasar lalu lintas yang diharapkan untuk mendeteksi penurunan tak terduga.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 300

**HTTP API **

**4xx**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm ketika tingkat kesalahan 4xx rata-rata melebihi 5% untuk tahap API HTTP.  
**Maksud: ** Mendeteksi tingkat kesalahan klien yang tinggi pada titik akhir API HTTP.  
**Kriteria PromQL: ** `avg({__name__="4xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Men ** deteksi tingkat kesalahan klien lebih besar dari 5%.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**5xx**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm ketika tingkat kesalahan 5xx rata-rata melebihi 5% untuk tahap API HTTP.  
**Maksud: ** Mendeteksi tingkat kesalahan server yang tinggi pada titik akhir API HTTP.  
**Kriteria PromQL: ** `avg({__name__="5xx", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Men ** deteksi tingkat kesalahan server yang lebih besar dari 5% yang memerlukan penyelidikan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 300

**Latensi**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm saat latensi p90 melebihi 2500 ms untuk tahap API HTTP.  
**Maksud: ** Mendeteksi latensi p90 tinggi pada titik akhir API HTTP.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="Latency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2500`  
**Ambang batas yang disarankan: ** 2500 (tertanam dalam kueri)  
**Pembenaran ambang batas: Latensi p90 di atas 2500 ms menunjukkan waktu respons ** yang menurun.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**IntegrationLatency**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm saat latensi integrasi p90 melebihi 2000 ms untuk tahap API HTTP.  
**Maksud: ** Mendeteksi latensi integrasi backend tinggi yang mempengaruhi waktu respons.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Ambang batas yang disarankan: ** 2000 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Latensi integrasi p90 di atas 2000 ms menunjukkan kelambatan backend.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**Hitungan**  
**Label: **ApiId, Panggung  
**Deskripsi ** alarm: Alarm saat jumlah permintaan total turun di bawah baseline yang diharapkan untuk tahap API HTTP.  
**Maksud: ** Mendeteksi volume lalu lintas rendah yang mungkin mengindikasikan masalah routing atau ketersediaan.  
**Kriteria PromQL: ** `sum({__name__="Count", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan garis dasar lalu lintas yang diharapkan untuk mendeteksi penurunan tak terduga.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 300

**WebSocket API**

**ClientError**  
**Label: **ApiId, Panggung  
**Deskripsi ** alarm: Alarm saat tingkat kesalahan klien rata-rata melebihi 5% untuk tahap WebSocket API.  
**Maksud: ** Mendeteksi tingkat kesalahan klien yang tinggi pada koneksi WebSocket API.  
**Kriteria PromQL: ** `avg({__name__="ClientError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Men ** deteksi tingkat kesalahan klien yang lebih besar dari 5% pada WebSocket koneksi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ExecutionError**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm ketika tingkat kesalahan eksekusi rata-rata melebihi 5% untuk tahap WebSocket API.  
**Maksud: ** Mendeteksi tingkat kesalahan eksekusi sisi server yang tinggi pada WebSocket API.  
**Kriteria PromQL: ** `avg({__name__="ExecutionError", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Mendeteksi tingkat kesalahan eksekusi yang lebih besar dari 5% yang membutuhkan penyelidikan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 300

**IntegrationLatency**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm saat latensi integrasi p90 melebihi 2000 ms untuk tahap WebSocket API.  
**Maksud: ** Mendeteksi latensi integrasi backend tinggi pada rute WebSocket API.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="IntegrationLatency", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) > 2000`  
**Ambang batas yang disarankan: ** 2000 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Latensi integrasi p90 di atas 2000 ms menunjukkan kelambatan backend.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**MessageCount**  
**Label: **ApiId, Panggung  
**Deskripsi alarm: ** Alarm saat jumlah total pesan turun di bawah baseline yang diharapkan untuk tahap WebSocket API.  
**Intent: ** Mendeteksi volume pesan rendah yang mungkin mengindikasikan masalah koneksi atau routing.  
**Kriteria PromQL: ** `sum({__name__="MessageCount", "@instrumentation.@name"="cloudwatch.aws/apigateway", ApiId="{{your-api-id}}",Stage="{{your-stage}}"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan volume pesan yang diharapkan untuk mendeteksi penurunan tak terduga.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 300

## Auto Scaling
<a name="Recommended_PromQL_AutoScaling"></a>

**GroupInServiceCapacity**  
**Label: ** AutoScalingGroupName  
**Deskripsi alarm: ** Alarm saat kapasitas rata-rata dalam layanan turun di bawah minimum yang diharapkan untuk grup Penskalaan Otomatis.  
**Maksud: ** Mendeteksi ketersediaan rendah karena kegagalan peluncuran atau instans yang dihentikan.  
**Kriteria PromQL: ** `avg({__name__="GroupInServiceCapacity", "@instrumentation.@name"="cloudwatch.aws/autoscaling", AutoScalingGroupName="{{your-auto-scaling-group-name}}"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kapasitas minimum yang diinginkan untuk mendeteksi kegagalan peluncuran atau instans yang tidak mencukupi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

## Manajer Sertifikat
<a name="Recommended_PromQL_CertificateManager"></a>

**DaysToExpiry**  
**Label: ** CertificateArn  
**Deskripsi alarm: ** Alarm ketika hari minimum hingga kadaluwarsa sertifikat turun menjadi 44 hari atau kurang.  
**Maksud: ** Peringatan kedaluwarsa sertifikat proaktif untuk memberikan waktu perpanjangan.  
**Kriteria PromQL: ** `min({__name__="DaysToExpiry", "@instrumentation.@name"="cloudwatch.aws/certificatemanager", CertificateArn="{{your-certificate-arn}}"}) <= 44`  
**Ambang batas yang disarankan: ** 44 (tertanam dalam kueri)  
**Pembenaran ambang batas: Men ** yediakan waktu tunggu yang cukup sebelum sertifikat kedaluwarsa untuk menyelesaikan proses perpanjangan.  
**Interval evaluasi: ** 86400  
**Periode tertunda: ** 86400  
**Periode pemulihan: ** 86400

## CloudFront
<a name="Recommended_PromQL_CloudFront"></a>

**5xxErrorRate**  
**Label: ** DistributionId  
**Deskripsi alarm: ** Alarm ketika tingkat kesalahan 5xx rata-rata melebihi ambang batas untuk CloudFront distribusi.  
**Maksud: ** Mendeteksi tingkat asal atau CloudFront kesalahan tinggi yang mempengaruhi pengiriman konten.  
**Kriteria PromQL: ** `avg({__name__="5xxErrorRate", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat kesalahan yang dapat diterima untuk pengiriman konten.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**OriginLatency**  
**Label: ** DistributionId  
**Deskripsi alarm: ** Alarm saat latensi asal p90 melebihi ambang batas untuk CloudFront distribusi.  
**Maksud: ** Mendeteksi latensi respons asal yang tinggi yang memengaruhi kinerja pengiriman konten.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="OriginLatency", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan waktu respons asal yang diharapkan dan strategi caching.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**FunctionValidationErrors**  
**Label: **DistributionId, FunctionName  
**Deskripsi alarm: ** Alarm ketika terjadi kesalahan validasi CloudFront fungsi.  
**Intent: ** Men CloudFront deteksi kegagalan validasi fungsi yang mencegah eksekusi fungsi.  
**Kriteria PromQL: ** `sum({__name__="FunctionValidationErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap kesalahan validasi menunjukkan masalah konfigurasi fungsi yang membutuhkan perhatian.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 120  
**Periode pemulihan: ** 120

**FunctionExecutionErrors**  
**Label: **DistributionId, FunctionName  
**Deskripsi alarm: ** Alarm ketika terjadi kesalahan eksekusi CloudFront fungsi.  
**Intent: ** Mendeteksi kegagalan runtime dalam CloudFront fungsi yang memengaruhi pemrosesan permintaan.  
**Kriteria PromQL: ** `sum({__name__="FunctionExecutionErrors", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap kesalahan eksekusi menunjukkan masalah runtime dalam kode fungsi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**FunctionThrottles**  
**Label: **DistributionId, FunctionName  
**Deskripsi alarm: ** Alarm ketika terjadi CloudFront pelambatan fungsi.  
**Intent: ** Mendeteksi pembatasan CloudFront fungsi yang mungkin menurunkan pemrosesan permintaan.  
**Kriteria PromQL: ** `sum({__name__="FunctionThrottles", "@instrumentation.@name"="cloudwatch.aws/cloudfront", DistributionId="{{your-distribution-id}}",FunctionName="{{your-function-name}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap pelambatan menunjukkan fungsi mencapai batas komputasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## Cognito
<a name="Recommended_PromQL_Cognito"></a>

**SignUpThrottles**  
**Label: **UserPool, UserPoolClient  
**Deskripsi alarm: ** Alarm saat peristiwa throttle pendaftaran melebihi ambang batas untuk kumpulan pengguna.  
**Maksud: ** Mendeteksi pelambatan pendaftaran yang mencegah pendaftaran pengguna baru.  
**Kriteria PromQL: ** `sum({__name__="SignUpThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat throttle yang dapat diterima untuk operasi pendaftaran.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**SignInThrottles**  
**Label: **UserPool, UserPoolClient  
**Deskripsi alarm: ** Alarm saat peristiwa throttle masuk melebihi ambang batas untuk kumpulan pengguna.  
**Maksud: ** Mendeteksi pembatasan masuk yang mencegah otentikasi pengguna.  
**Kriteria PromQL: ** `sum({__name__="SignInThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat throttle yang dapat diterima untuk operasi masuk.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TokenRefreshThrottles**  
**Label: **UserPool, UserPoolClient  
**Deskripsi alarm: ** Alarm saat peristiwa throttle refresh token melebihi ambang batas untuk kumpulan pengguna.  
**Maksud: ** Mendeteksi pelambatan penyegaran token yang dapat menyebabkan gangguan sesi.  
**Kriteria PromQL: ** `sum({__name__="TokenRefreshThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kecepatan throttle yang dapat diterima untuk operasi penyegaran token.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**FederationThrottles**  
**Label: **UserPool, UserPoolClient, IdentityProvider  
**Deskripsi alarm: ** Alarm saat peristiwa throttle federasi melebihi ambang batas untuk penyedia identitas kumpulan pengguna.  
**Maksud: ** Mendeteksi pembatasan federasi yang mungkin mencegah masuk federasi.  
**Kriteria PromQL: ** `sum({__name__="FederationThrottles", "@instrumentation.@name"="cloudwatch.aws/cognito", UserPool="{{your-user-pool}}",UserPoolClient="{{your-user-pool-client}}",IdentityProvider="{{your-identity-provider}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat throttle yang dapat diterima untuk operasi federasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## DynamoDB
<a name="Recommended_PromQL_DynamoDB"></a>

**AccountProvisionedReadCapacityUtilization**  
**Label: Tidak ** ada  
**Deskripsi alarm: ** Alarm saat pemanfaatan kapasitas baca yang disediakan tingkat akun melebihi 80%.  
**Maksud: ** Mendeteksi saat kapasitas baca yang disediakan mendekati batas akun.  
**Kriteria PromQL: ** `max({__name__="AccountProvisionedReadCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Pada pemanfaatan 80%, Anda memiliki headroom terbatas sebelum mencapai batas akun.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**AccountProvisionedWriteCapacityUtilization**  
**Label: Tidak ** ada  
**Deskripsi alarm: ** Alarm saat pemanfaatan kapasitas tulis yang disediakan tingkat akun melebihi 80%.  
**Maksud: ** Mendeteksi saat kapasitas tulis yang disediakan mendekati batas akun.  
**Kriteria PromQL: ** `max({__name__="AccountProvisionedWriteCapacityUtilization", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Pada pemanfaatan 80%, Anda memiliki headroom terbatas sebelum mencapai batas akun.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**AgeOfOldestUnreplicatedRecord**  
**Label: **TableName, DelegatedOperation  
**Deskripsi alarm: ** Alarm saat usia catatan tertua yang tidak direplikasi melebihi ambang batas.  
**Maksud: ** Mendeteksi jeda replikasi yang mungkin menyebabkan data basi di tabel global.  
**Kriteria PromQL: ** `max({__name__="AgeOfOldestUnreplicatedRecord", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan persyaratan kesegaran replikasi Anda.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**FailedToReplicateRecordCount**  
**Label: **TableName, DelegatedOperation  
**Deskripsi alarm: ** Alarm ketika ada catatan yang gagal direplikasi dalam tabel global.  
**Maksud: ** Mendeteksi kegagalan replikasi yang menyebabkan inkonsistensi data di seluruh wilayah.  
**Kriteria PromQL: ** `sum({__name__="FailedToReplicateRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap replikasi yang gagal menunjukkan masalah konsistensi data yang memerlukan perhatian segera.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 60  
**Periode pemulihan: ** 60

**ReadThrottleEvents**  
**Label: ** TableName  
**Deskripsi alarm: ** Alarm saat membaca peristiwa throttle melebihi ambang batas untuk tabel.  
**Intent: Men ** deteksi pembatasan baca yang menunjukkan kapasitas yang disediakan tidak mencukupi.  
**Kriteria PromQL: ** `sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi baca.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ReadThrottleEvents (GSI) **  
**Label: **TableName, GlobalSecondaryIndexName  
**Deskripsi alarm: ** Alarm saat membaca peristiwa throttle melebihi ambang batas untuk indeks sekunder global.  
**Intent: ** Mendeteksi pembatasan baca pada GSI yang menunjukkan kapasitas indeks tidak mencukupi.  
**Kriteria PromQL: ** `sum({__name__="ReadThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi baca GSI.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ReplicationLatency**  
**Label: **TableName, ReceivingRegion  
**Deskripsi alarm: ** Alarm saat latensi replikasi rata-rata melebihi ambang batas untuk tabel global.  
**Maksud: ** Mendeteksi latensi replikasi tinggi yang dapat menyebabkan pembacaan basi di wilayah replika.  
**Kriteria PromQL: ** `avg({__name__="ReplicationLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",ReceivingRegion="{{your-receiving-region}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan persyaratan kesegaran data Anda untuk wilayah replika.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**SuccessfulRequestLatency**  
**Label: **TableName, Operasi  
**Deskripsi alarm: ** Alarm ketika latensi permintaan rata-rata berhasil melebihi ambang batas untuk operasi tabel.  
**Intent: ** Mendeteksi latensi tinggi pada operasi DynamoDB yang mempengaruhi kinerja aplikasi.  
**Kriteria PromQL: ** `avg({__name__="SuccessfulRequestLatency", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",Operation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan SLA latensi Anda untuk operasi DynamoDB tertentu.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**SystemErrors**  
**Label: ** TableName  
**Deskripsi alarm: ** Alarm ketika kesalahan sistem melebihi ambang batas untuk tabel.  
**Maksud: ** Mendeteksi kesalahan sisi layanan DynamoDB yang memengaruhi ketersediaan tabel.  
**Kriteria PromQL: ** `sum({__name__="SystemErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah kesalahan sistem yang dapat diterima untuk tabel.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**ThrottledPutRecordCount**  
**Label: **TableName, DelegatedOperation  
**Deskripsi alarm: ** Alarm saat jumlah catatan put yang dibatasi melebihi ambang batas untuk tabel.  
**Maksud: ** Mendeteksi putaran yang dibatasi yang dapat menyebabkan hilangnya data dalam operasi streaming.  
**Kriteria PromQL: ** `max({__name__="ThrottledPutRecordCount", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",DelegatedOperation="{{your-operation}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi put streaming.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**UserErrors**  
**Label: Tidak ** ada  
**Deskripsi alarm: ** Alarm saat kesalahan pengguna melebihi ambang batas di seluruh akun.  
**Maksud: ** Mendeteksi tingkat kesalahan klien yang tinggi seperti validasi atau kegagalan pemeriksaan bersyarat.  
**Kriteria PromQL: ** `sum({__name__="UserErrors", "@instrumentation.@name"="cloudwatch.aws/dynamodb"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat kesalahan yang dapat diterima untuk kegagalan permintaan sisi klien.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**WriteThrottleEvents**  
**Label: ** TableName  
**Deskripsi alarm: ** Alarm saat menulis peristiwa throttle melebihi ambang batas untuk tabel.  
**Intent: Men ** deteksi pembatasan tulis yang menunjukkan kapasitas yang disediakan tidak mencukupi.  
**Kriteria PromQL: ** `sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi penulisan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**WriteThrottleEvents (GSI) **  
**Label: **TableName, GlobalSecondaryIndexName  
**Deskripsi alarm: ** Alarm saat menulis peristiwa throttle melebihi ambang batas untuk indeks sekunder global.  
**Intent: ** Mendeteksi pembatasan tulis pada GSI yang menunjukkan kapasitas indeks tidak mencukupi.  
**Kriteria PromQL: ** `sum({__name__="WriteThrottleEvents", "@instrumentation.@name"="cloudwatch.aws/dynamodb", TableName="{{your-table-name}}",GlobalSecondaryIndexName="{{your-index-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah throttle yang dapat diterima untuk operasi penulisan GSI.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## EBS
<a name="Recommended_PromQL_EBS"></a>

**VolumeStalledIOCheck**  
**Label: **VolumeId, InstanceId  
**Deskripsi alarm: ** Alarm saat volume EBS melaporkan kegagalan pemeriksaan yang terhenti I/O .  
**Maksud: ** Mendeteksi terhenti I/O pada volume EBS yang mengindikasikan penurunan volume.  
**Kriteria PromQL: ** `max({__name__="VolumeStalledIOCheck", "@instrumentation.@name"="cloudwatch.aws/ebs", VolumeId="{{your-volume-id}}",InstanceId="{{your-instance-id}}"}) >= 1`  
**Ambang batas yang disarankan: ** 1 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Nilai 1 atau lebih besar menunjukkan volume telah terhenti I/O, memerlukan penyelidikan segera.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

## Amazon Elastic Compute Cloud
<a name="Recommended_PromQL_EC2"></a>

**CPUUtilization**  
**Label: ** InstanceId  
**Deskripsi alarm: ** Alarm saat pemanfaatan CPU rata-rata melebihi 80% untuk instans EC2.  
**Maksud: Men ** deteksi pemanfaatan CPU yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Ambang batas 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**StatusCheckFailed**  
**Label: ** InstanceId  
**Deskripsi alarm: ** Alarm saat pemeriksaan kesehatan instans atau sistem gagal untuk instans EC2.  
**Maksud: ** Mendeteksi instans atau masalah kesehatan sistem.  
**Kriteria PromQL: ** `max({__name__="StatusCheckFailed", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Ambang batas yang disarankan: ** 1 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap kegagalan pemeriksaan status memerlukan penyelidikan.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**StatusCheckFailed\_AttacheBs **  
**Label: ** InstanceId  
**Deskripsi alarm: ** Alarm saat volume EBS yang terpasang menjadi tidak dapat dijangkau untuk instans EC2.  
**Maksud: Men ** deteksi volume EBS yang tidak dapat dijangkau.  
**Kriteria PromQL: ** `max({__name__="StatusCheckFailed_AttachedEBS", "@instrumentation.@name"="cloudwatch.aws/ec2", InstanceId="{{your-instance-id}}"}) >= 1`  
**Ambang batas yang disarankan: ** 1 (tertanam dalam kueri)  
**Pembenaran ambang batas: Vol ** ume yang tidak dapat dijangkau menyebabkan kegagalan I/O .  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

## Amazon ECS
<a name="Recommended_PromQL_ECS"></a>

**CPUReservation**  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika reservasi CPU rata-rata melebihi 80% untuk cluster ECS.  
**Maksud: ** Mendeteksi cluster mendekati kapasitas CPU.  
**Kriteria PromQL: ** `avg({__name__="CPUReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% reservasi menunjukkan ruang kepala terbatas untuk tugas-tugas baru.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**CPUUtilization**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU rata-rata melebihi 80% untuk layanan ECS.  
**Maksud: Men ** deteksi pemanfaatan CPU yang tinggi untuk layanan ECS.  
**Kriteria PromQL: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**EBSFilesystemUtilization**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan sistem file EBS rata-rata melebihi 80% untuk layanan ECS.  
**Maksud: Men ** deteksi pemanfaatan penyimpanan EBS yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="EBSFilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**MemoryReservation**  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika reservasi memori rata-rata melebihi 80% untuk cluster ECS.  
**Maksud: ** Mendeteksi cluster mendekati kapasitas memori.  
**Kriteria PromQL: ** `avg({__name__="MemoryReservation", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% reservasi menunjukkan ruang kepala terbatas untuk tugas-tugas baru.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**MemoryUtilization**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori rata-rata melebihi 80% untuk layanan ECS.  
**Maksud: Men ** deteksi pemanfaatan memori yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="MemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**HTTP Code\_Target \_5xx\_Count **  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm saat jumlah kesalahan HTTP 5XX melebihi ambang batas untuk layanan ECS.  
**Maksud: ** Mendeteksi jumlah kesalahan sisi server yang tinggi.  
**Kriteria PromQL: ** `sum({__name__="HTTPCode_Target_5XX_Count", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan baseline tingkat kesalahan normal aplikasi Anda.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TargetResponseTime**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika waktu respons target rata-rata melebihi ambang batas untuk layanan ECS.  
**Maksud: ** Mendeteksi waktu respons target yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TargetResponseTime", "@instrumentation.@name"="cloudwatch.aws/ecs", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan persyaratan latensi aplikasi yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## Wawasan Kontainer Amazon ECS
<a name="Recommended_PromQL_ECS_ContainerInsights"></a>

**EphemeralStorageUtilized**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika penggunaan penyimpanan sementara rata-rata melebihi ambang batas untuk tugas Fargate.  
**Maksud: ** Mendeteksi penggunaan penyimpanan sementara yang tinggi untuk tugas Fargate.  
**Kriteria PromQL: ** `avg({__name__="EphemeralStorageUtilized", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan alokasi penyimpanan sementara tugas Anda.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**RunningTaskCount**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm saat jumlah tugas yang sedang berjalan turun ke nol untuk layanan ECS.  
**Maksud: ** Mendeteksi saat tidak ada tugas yang berjalan.  
**Kriteria PromQL: ** `avg({__name__="RunningTaskCount", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) <= 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: Tugas yang berjalan ** nol menunjukkan pemadaman layanan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**instance\_filesystem\_utilization**  
**Label: **InstanceId, ContainerInstanceId, ClusterName  
**Deskripsi alarm: ** Alarm saat pemanfaatan sistem file rata-rata melebihi 90% pada instance kontainer.  
**Maksud: Men ** deteksi pemanfaatan sistem file yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="instance_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", InstanceId="{{your-instance-id}}",ContainerInstanceId="{{your-container-instance-id}}",ClusterName="{{your-cluster-name}}"}) > 90`  
**Ambang yang disarankan: ** 90 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 90% pemanfaatan sistem file menyisakan ruang minimal untuk operasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## Amazon ECS Container Insights meningkatkan pengamatan
<a name="Recommended_PromQL_ECS_ContainerInsights_Enhanced"></a>

**TaskCpuUtilization (tingkat cluster) **  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU tugas rata-rata melebihi 80% di tingkat cluster.  
**Maksud: Men ** deteksi pemanfaatan CPU yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TaskCpuUtilization (tingkat layanan) **  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU tugas rata-rata melebihi 80% pada tingkat layanan.  
**Maksud: Men ** deteksi pemanfaatan CPU yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TaskMemoryUtilization (tingkat cluster) **  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori tugas rata-rata melebihi 80% di tingkat cluster.  
**Maksud: Men ** deteksi pemanfaatan memori yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TaskMemoryUtilization (tingkat layanan) **  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori tugas rata-rata melebihi 80% pada tingkat layanan.  
**Maksud: Men ** deteksi pemanfaatan memori yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ContainerCpuUtilization (tingkat cluster) **  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU kontainer rata-rata melebihi 80% di tingkat cluster.  
**Maksud: Men ** deteksi pemanfaatan CPU yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ContainerCpuUtilization (tingkat kontainer) **  
**Label: **ContainerName, ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU kontainer rata-rata melebihi 80% pada tingkat kontainer.  
**Maksud: Men ** deteksi pemanfaatan CPU yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="ContainerCpuUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ContainerMemoryUtilization (tingkat cluster) **  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori kontainer rata-rata melebihi 80% di tingkat cluster.  
**Maksud: Men ** deteksi pemanfaatan memori yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ContainerMemoryUtilization (tingkat kontainer) **  
**Label: **ContainerName, ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori kontainer rata-rata melebihi 80% pada tingkat kontainer.  
**Maksud: Men ** deteksi pemanfaatan memori yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="ContainerMemoryUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ContainerName="{{your-container-name}}",ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TaskEBSfilesystemUtilization**  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan sistem file EBS rata-rata melebihi 80% untuk tugas.  
**Maksud: Men ** deteksi pemanfaatan sistem file EBS yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskEBSfilesystemUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TaskEphemeralStorageUtilization (tingkat cluster) **  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan penyimpanan sementara rata-rata melebihi 80% di tingkat cluster.  
**Maksud: Men ** deteksi pemanfaatan penyimpanan sementara yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**TaskEphemeralStorageUtilization (tingkat layanan) **  
**Label: **ClusterName, ServiceName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan penyimpanan sementara rata-rata melebihi 80% pada tingkat layanan.  
**Maksud: Men ** deteksi pemanfaatan penyimpanan sementara yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="TaskEphemeralStorageUtilization", "@instrumentation.@name"="cloudwatch.aws/ecs-containerinsights", ClusterName="{{your-cluster-name}}",ServiceName="{{your-service-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## Amazon EFS
<a name="Recommended_PromQL_EFS"></a>

**PercentIOLimit**  
**Label: ** FileSystemId  
**Deskripsi alarm: ** Alarm ketika sistem file EFS mencapai 100% dari bat I/O asnya.  
**Maksud: ** Mendeteksi ketika sistem file mencapai I/O batas.  
**Kriteria PromQL: ** `avg({__name__="PercentIOLimit", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) >= 100`  
**Ambang batas yang disarankan: ** 100 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Pada 100% sistem file menjadi hambatan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**BurstCreditBalance**  
**Label: ** FileSystemId  
**Deskripsi alarm: ** Alarm saat saldo kredit burst turun ke nol untuk sistem file EFS.  
**Maksud: Men ** deteksi kredit burst yang habis yang menyebabkan perlambatan throughput.  
**Kriteria PromQL: ** `avg({__name__="BurstCreditBalance", "@instrumentation.@name"="cloudwatch.aws/efs", FileSystemId="{{your-filesystem-id}}"}) <= 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang ** batas: Nol kredit menyebabkan penurunan throughput.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

## Wawasan Kontainer Amazon EKS
<a name="Recommended_PromQL_EKS"></a>

**node\_cpu\_utilization**  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU maksimum melebihi 80% pada node pekerja EKS.  
**Maksud: ** Mendeteksi CPU tinggi pada node pekerja.  
**Kriteria PromQL: ** `max({__name__="node_cpu_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**node\_filesystem\_utilization**  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm saat pemanfaatan sistem file maksimum melebihi ambang batas pada node pekerja EKS.  
**Maksud: ** Mendeteksi penggunaan sistem file yang tinggi pada node pekerja.  
**Kriteria PromQL: ** `max({__name__="node_filesystem_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kapasitas penyimpanan dan pola penggunaan node Anda.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**node\_memory\_utilization**  
**Label: ** ClusterName  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori maksimum melebihi 80% pada node pekerja EKS.  
**Maksud: ** Mendeteksi memori tinggi pada node pekerja.  
**Kriteria PromQL: ** `max({__name__="node_memory_utilization", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**pod\_cpu\_utilization\_over\_pod\_limit**  
**Tags: **ClusterName, Namespace, Layanan  
**Deskripsi alarm: ** Alarm saat pemanfaatan CPU pod melebihi 80% dari batasnya.  
**Maksud: ** Mendeteksi pod mendekati batas CPU.  
**Kriteria PromQL: ** `max({__name__="pod_cpu_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum pelambatan terjadi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**pod\_memory\_utilization\_over\_pod\_limit**  
**Tags: **ClusterName, Namespace, Layanan  
**Deskripsi alarm: ** Alarm saat pemanfaatan memori pod melebihi 80% dari batasnya.  
**Maksud: ** Mendeteksi pod mendekati batas memori.  
**Kriteria PromQL: ** `max({__name__="pod_memory_utilization_over_pod_limit", "@instrumentation.@name"="cloudwatch.aws/eks-containerinsights", ClusterName="{{your-cluster-name}}",Namespace="{{your-namespace}}",Service="{{your-service}}"}) > 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 80% memberikan ruang kepala sebelum oomKill terjadi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## Amazon ElastiCache
<a name="Recommended_PromQL_ElastiCache"></a>

**CPUUtilization**  
**Label: **CacheClusterId, CacheNodeId  
**Deskripsi alarm: ** Alarm ketika pemanfaatan CPU rata-rata melebihi ambang batas untuk ElastiCache node.  
**Intent: ** Mendeteksi CPU tinggi di seluruh instance.  
**Kriteria PromQL: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jenis node dan karakteristik beban kerja Anda.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**CurrConnections**  
**Label: **CacheClusterId, CacheNodeId  
**Deskripsi alarm: ** Alarm saat jumlah koneksi melebihi ambang batas untuk ElastiCache node.  
**Maksud: ** Mendeteksi jumlah koneksi yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="CurrConnections", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}",CacheNodeId="{{your-cache-node-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan ukuran kumpulan koneksi yang diharapkan dan kebutuhan aplikasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**DatabaseMemoryUsagePercentage**  
**Label: ** CacheClusterId  
**Deskripsi alarm: ** Alarm saat penggunaan memori database melebihi ambang batas untuk ElastiCache cluster.  
**Maksud: ** Mendeteksi penggunaan memori yang tinggi untuk mencegah kegagalan penulisan.  
**Kriteria PromQL: ** `avg({__name__="DatabaseMemoryUsagePercentage", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kebijakan penggusuran dan kekritisan data Anda.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**EngineCPUUtilization**  
**Label: ** CacheClusterId  
**Deskripsi alarm: ** Alarm saat pemanfaatan CPU mesin Redis melebihi 90% untuk ElastiCache cluster.  
**Maksud: Men ** deteksi pemanfaatan CPU mesin Redis yang tinggi.  
**Kriteria PromQL: ** `avg({__name__="EngineCPUUtilization", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > 90`  
**Ambang yang disarankan: ** 90 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Redis adalah single-thread; lebih besar dari 90% menunjukkan saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ReplicationLag**  
**Label: ** CacheClusterId  
**Deskripsi alarm: ** Alarm saat jeda replikasi melebihi ambang batas untuk ElastiCache cluster.  
**Maksud: Men ** deteksi penundaan replikasi yang mempengaruhi konsistensi data.  
**Kriteria PromQL: ** `avg({__name__="ReplicationLag", "@instrumentation.@name"="cloudwatch.aws/elasticache", CacheClusterId="{{your-cache-cluster-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan toleransi aplikasi Anda untuk pembacaan basi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

## GPU elastis
<a name="Recommended_PromQL_ElasticGPUs"></a>

**GPUConnectivityCheckFailed**  
**Label: **InstanceId, EGpuid  
**Deskripsi alarm: ** Alarm saat akselerator Elastic Graphics kehilangan konektivitas ke instance.  
**Maksud: Men ** deteksi masalah konektivitas ke akselerator Elastic Graphics.  
**Kriteria PromQL: ** `max({__name__="GPUConnectivityCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap kegagalan konektivitas memerlukan penyelidikan.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**GPUHealthCheckFailed**  
**Label: **InstanceId, EGpuid  
**Deskripsi alarm: ** Alarm saat pemeriksaan kesehatan akselerator Elastic Graphics gagal.  
**Maksud: Men ** deteksi akselerator Grafik Elastis yang tidak sehat.  
**Kriteria PromQL: ** `max({__name__="GPUHealthCheckFailed", "@instrumentation.@name"="cloudwatch.aws/elasticgpus", InstanceId="{{your-instance-id}}",EGPUId="{{your-egpu-id}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Kegagalan pemeriksaan kesehatan menunjukkan masalah akselerator.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

## Pen EventBridge jadwal Amazon
<a name="Recommended_PromQL_Scheduler"></a>

**TargetErrorThrottledCount**  
**Deskripsi alarm: ** Alarm saat pemanggilan target jadwal dibatasi.  
**Maksud: Men ** deteksi pelambatan target yang menyebabkan penundaan jadwal.  
**Kriteria PromQL: ** `sum({__name__="TargetErrorThrottledCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap pelambatan menunjukkan masalah kapasitas target.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**InvocationThrottleCount**  
**Deskripsi alarm: ** Alarm saat pemanggilan Scheduler dibatasi.  
**Maksud: Men ** deteksi pembatasan pemanggilan Penjadwal.  
**Kriteria PromQL: ** `sum({__name__="InvocationThrottleCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Pembatasan menunda eksekusi terjadwal.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**InvocationDroppedCount**  
**Deskripsi alarm: ** Alarm saat pemanggilan terjadwal dijatuhkan.  
**Maksud: Men ** deteksi panggilan yang terputus.  
**Kriteria PromQL: ** `sum({__name__="InvocationDroppedCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Panggilan yang dibatalkan mewakili peristiwa terjadwal yang hilang.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 60  
**Periode pemulihan: ** 60

**InvocationsFailedToBeSentToDeadLetterCount**  
**Deskripsi alarm: ** Alarm saat pemanggilan gagal tidak dapat dikirim ke antrian huruf mati.  
**Maksud: ** Mendeteksi kegagalan pengiriman DLQ.  
**Kriteria PromQL: ** `sum({__name__="InvocationsFailedToBeSentToDeadLetterCount", "@instrumentation.@name"="cloudwatch.aws/scheduler"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: Pengiriman DLQ ** gagal berarti informasi kesalahan hilang.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

## Amazon Kinesis Data Streams
<a name="Recommended_PromQL_Kinesis"></a>

**GetRecords.IteratorAgeMilliseconds**  
**Label: ** StreamName  
**Deskripsi alarm: ** Alarm saat usia iterator konsumen melebihi ambang batas untuk aliran Kinesis.  
**Maksud: ** Mendeteksi data yang tertinggal dari periode retensi yang berisiko kehilangan data.  
**Kriteria PromQL: ** `max({__name__="GetRecords.IteratorAgeMilliseconds", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan persentase periode retensi aliran.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**GetRecords.Success**  
**Label: ** StreamName  
**Deskripsi alarm: ** Alarm saat tingkat GetRecords keberhasilan turun di bawah ambang batas untuk aliran Kinesis.  
**Maksud: ** Mendeteksi kegagalan pengambilan konsumen.  
**Kriteria PromQL: ** `avg({__name__="GetRecords.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat keberhasilan yang diharapkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**PutRecord.Success**  
**Label: ** StreamName  
**Deskripsi alarm: ** Alarm saat tingkat PutRecord keberhasilan turun di bawah ambang batas untuk aliran Kinesis.  
**Maksud: ** Mendeteksi kegagalan konsumsi produsen.  
**Kriteria PromQL: ** `avg({__name__="PutRecord.Success", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat keberhasilan yang diharapkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**PutRecords.FailedRecords**  
**Label: ** StreamName  
**Deskripsi alarm: ** Alarm saat operasi batch put menghasilkan catatan yang gagal untuk aliran Kinesis.  
**Maksud: ** Mendeteksi kegagalan batch put.  
**Kriteria PromQL: ** `sum({__name__="PutRecords.FailedRecords", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah kegagalan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ReadProvisionedThroughputExceeded**  
**Label: ** StreamName  
**Deskripsi alarm: ** Alarm saat pembacaan konsumen melebihi throughput yang disediakan untuk aliran Kinesis.  
**Maksud: Men ** deteksi pembatasan pembacaan konsumen.  
**Kriteria PromQL: ** `avg({__name__="ReadProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap pelambatan berkelanjutan menunjukkan kebutuhan kapasitas.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**SubscribeToShardEvent.MillisBehindLatest**  
**Label: **StreamName, ConsumerName  
**Deskripsi alarm: ** Alarm saat konsumen fan-out yang ditingkatkan tertinggal dari rekor terbaru.  
**Maksud: ** Mendeteksi kelambatan pemrosesan konsumen yang ditingkatkan.  
**Kriteria PromQL: ** `avg({__name__="SubscribeToShardEvent.MillisBehindLatest", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}",ConsumerName="{{your-consumer-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Tetapkan berdasarkan penundaan pemrosesan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**WriteProvisionedThroughputExceeded**  
**Label: ** StreamName  
**Deskripsi alarm: ** Alarm saat produsen menulis melebihi throughput yang disediakan untuk aliran Kinesis.  
**Maksud: ** Mendeteksi pembatasan tulis produsen.  
**Kriteria PromQL: ** `avg({__name__="WriteProvisionedThroughputExceeded", "@instrumentation.@name"="cloudwatch.aws/kinesis", StreamName="{{your-stream-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Pelambatan ** berkelanjutan menunjukkan kebutuhan kapasitas.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## AWS Lambda
<a name="Recommended_PromQL_Lambda"></a>

**ClaimedAccountConcurrency**  
**Deskripsi alarm: ** Alarm saat konkurensi akun yang diklaim melebihi ambang batas.  
**Maksud: ** Mendeteksi akun mendekati kuota konkurensi.  
**Kriteria PromQL: ** `max({__name__="ClaimedAccountConcurrency", "@instrumentation.@name"="cloudwatch.aws/lambda"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setel ke persentase batas konkurensi regional.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**Kesalahan**  
**Label: ** FunctionName  
**Deskripsi alarm: ** Alarm ketika jumlah kesalahan fungsi melebihi ambang batas untuk fungsi Lambda.  
**Maksud: ** Mendeteksi jumlah kesalahan fungsi yang tinggi.  
**Kriteria PromQL: ** `sum({__name__="Errors", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan volume kesalahan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 300

**Pembatasan**  
**Label: ** FunctionName  
**Deskripsi alarm: ** Alarm saat pemanggilan fungsi dibatasi untuk fungsi Lambda.  
**Maksud: Men ** deteksi pembatasan pemanggilan fungsi.  
**Kriteria PromQL: ** `sum({__name__="Throttles", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Throttling menunjukkan batas konkurensi tercapai.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**Durasi**  
**Label: ** FunctionName  
**Deskripsi alarm: ** Alarm ketika durasi fungsi p90 melebihi ambang batas untuk fungsi Lambda.  
**Maksud: Men ** deteksi pemanggilan fungsi yang berjalan lama.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="Duration", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan relatif ke batas waktu fungsi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**ConcurrentExecutions**  
**Label: ** FunctionName  
**Deskripsi alarm: ** Alarm saat eksekusi bersamaan melebihi ambang batas untuk fungsi Lambda.  
**Intent: ** Mendeteksi fungsi mendekati batas konkurensi.  
**Kriteria PromQL: ** `max({__name__="ConcurrentExecutions", "@instrumentation.@name"="cloudwatch.aws/lambda", FunctionName="{{your-function-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setel ke persentase konkurensi yang dicadangkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

## AWS Lambda Wawasan
<a name="Recommended_PromQL_LambdaInsights"></a>

**memory\_utilization**  
**Label: ** function\_name  
**Deskripsi alarm: ** Alarm ketika pemanfaatan memori rata-rata melebihi 90% untuk fungsi Lambda.  
**Maksud: ** Mendeteksi fungsi mendekati batas memori yang dikonfigurasi.  
**Kriteria PromQL: ** `avg({__name__="memory_utilization", "@instrumentation.@name"="cloudwatch.aws/lambda-insights", function_name="{{your-function-name}}"}) > 90`  
**Ambang yang disarankan: ** 90 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 90% berisiko kegagalan memori.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

## Gerbang NAT
<a name="Recommended_PromQL_NATGateway"></a>

**ErrorPortAllocation**  
**Label: ** NatGatewayId  
**Deskripsi alarm: ** Alarm saat gateway NAT gagal mengalokasikan port untuk koneksi baru.  
**Maksud: ** Mendeteksi kegagalan alokasi port yang mencegah koneksi baru.  
**Kriteria PromQL: ** `sum({__name__="ErrorPortAllocation", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap kegagalan alokasi berdampak pada konektivitas.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**PacketsDropCount**  
**Label: ** NatGatewayId  
**Deskripsi alarm: ** Alarm saat gateway NAT menjatuhkan paket melebihi ambang batas.  
**Maksud: ** Mendeteksi penurunan paket yang menunjukkan kapasitas atau masalah konektivitas.  
**Kriteria PromQL: ** `sum({__name__="PacketsDropCount", "@instrumentation.@name"="cloudwatch.aws/natgateway", NatGatewayId="{{your-nat-gateway-id}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat penurunan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## AWS PrivateLink titik akhir
<a name="Recommended_PromQL_PrivateLinkEndpoints"></a>

**PacketsDropped**  
**Label: **VpcId, VpcEndpointId, EndpointType, SubnetId, ServiceName  
**Deskripsi alarm: ** Alarm ketika titik akhir VPC menjatuhkan paket melebihi ambang batas.  
**Maksud: Men ** deteksi titik akhir atau layanan titik akhir yang tidak sehat.  
**Kriteria PromQL: ** `sum({__name__="PacketsDropped", "@instrumentation.@name"="cloudwatch.aws/privatelinkendpoints", VpcId="{{your-vpc-id}}",VpcEndpointId="{{your-vpc-endpoint-id}}",EndpointType="{{your-endpoint-type}}",SubnetId="{{your-subnet-id}}",ServiceName="{{your-service-name}}"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat penurunan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## AWS PrivateLink layanan
<a name="Recommended_PromQL_PrivateLinkServices"></a>

**RstPacketsSent**  
**Label: **ServiceId, LoadBalancerArn, Az  
**Deskripsi alarm: ** Alarm saat tingkat paket RST melebihi ambang batas untuk layanan titik akhir.  
**Maksud: ** Mendeteksi target layanan titik akhir yang tidak sehat.  
**Kriteria PromQL: ** `sum({__name__="RstPacketsSent", "@instrumentation.@name"="cloudwatch.aws/privatelinkservices", ServiceId="SVC",LoadBalancerArn="LB",Az="AZ"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat paket RST yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## RDS
<a name="Recommended_PromQL_RDS"></a>

**CPUUtilization**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat pemanfaatan CPU rata-rata melebihi 90% untuk instance RDS.  
**Maksud: ** Mendeteksi CPU tinggi mencegah penurunan kinerja.  
**Kriteria PromQL: ** `avg({__name__="CPUUtilization", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 90`  
**Ambang yang disarankan: ** 90 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 90% menunjukkan mendekati saturasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**DatabaseConnections**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat koneksi database melebihi ambang batas untuk instance RDS.  
**Maksud: ** Mencegah koneksi yang ditolak pada batas maksimum.  
**Kriteria PromQL: ** `avg({__name__="DatabaseConnections", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setel ke persentase parameter max\_connections.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**EBSByteBalance%**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat saldo byte EBS turun di bawah 10% untuk instance RDS.  
**Maksud: ** Mendeteksi kredit throughput rendah yang menyebabkan kemacetan.  
**Kriteria PromQL: ** `avg({__name__="EBSByteBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Ambang batas yang disarankan: ** 10 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** bawah 10% berisiko degradasi throughput.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 180

**EBSIOBalance%**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat saldo IO EBS turun di bawah 10% untuk instance RDS.  
**Maksud: Men ** deteksi kredit IOPS rendah yang menyebabkan kemacetan.  
**Kriteria PromQL: ** `avg({__name__="EBSIOBalance%", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 10`  
**Ambang batas yang disarankan: ** 10 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Di bawah 10% berisiko degradasi IOPS.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 180

**FreeableMemory**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat memori bebas turun di bawah ambang batas untuk instance RDS.  
**Maksud: Menc ** egah kehabisan memori yang menyebabkan koneksi ditolak.  
**Kriteria PromQL: ** `avg({__name__="FreeableMemory", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan memori kelas instance.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**FreeLocalStorage**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat penyimpanan lokal gratis turun di bawah ambang batas untuk instance Aurora.  
**Maksud: M ** encegah kehabisan penyimpanan lokal Aurora.  
**Kriteria PromQL: ** `avg({__name__="FreeLocalStorage", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan minimum yang diperlukan untuk operasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**FreeStorageSpace**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat ruang penyimpanan kosong turun di bawah ambang batas untuk instance RDS.  
**Maksud: M ** encegah downtime penuh penyimpanan.  
**Kriteria PromQL: ** `min({__name__="FreeStorageSpace", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat pertumbuhan penyimpanan dan ukuran yang disediakan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**MaximumUsedTransactionIDs**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat ID transaksi maksimum yang digunakan melebihi 1 miliar untuk instans RDS.  
**Maksud: M ** encegah pembungkus ID transaksi PostgreSQL.  
**Kriteria PromQL: ** `avg({__name__="MaximumUsedTransactionIDs", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000000`  
**Ambang yang disarankan: ** 1000000000 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 1 miliar menunjukkan bahaya yang mendekat.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 60  
**Periode pemulihan: ** 60

**ReadLatency**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat latensi baca p90 melebihi ambang batas untuk instance RDS.  
**Maksud: ** Mendeteksi latensi baca tinggi yang menunjukkan masalah disk.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="ReadLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan latensi aplikasi yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**ReplicaLag**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat jeda replikasi melebihi 60 detik untuk replika baca RDS.  
**Maksud: Men ** deteksi penundaan replikasi yang berisiko kehilangan data.  
**Kriteria PromQL: ** `max({__name__="ReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 60`  
**Ambang batas yang disarankan: ** 60 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** 60 detik mewakili jeda yang signifikan untuk sebagian besar beban kerja.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**WriteLatency**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat latensi tulis p90 melebihi ambang batas untuk instance RDS.  
**Maksud: ** Mendeteksi latensi tulis tinggi yang menunjukkan masalah disk.  
**Kriteria PromQL: ** `histogram_quantile(0.9, {__name__="WriteLatency", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan latensi aplikasi yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**DBLoad**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat beban database rata-rata melebihi ambang batas untuk instance RDS.  
**Maksud: ** Mendeteksi beban database yang tinggi yang menurunkan kinerja.  
**Kriteria PromQL: ** `avg({__name__="DBLoad", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setel ke kelipatan jumlah vCPU.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**AuroraVolumeBytesLeftTotal**  
**Label: ** DBClusterIdentifier  
**Deskripsi alarm: ** Alarm saat sisa byte penyimpanan cluster Aurora turun di bawah ambang batas.  
**Maksud: M ** encegah kehabisan penyimpanan cluster Aurora.  
**Kriteria PromQL: ** `avg({__name__="AuroraVolumeBytesLeftTotal", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat pertumbuhan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**AuroraBinlogReplicaLag**  
**Label: ** DBClusterIdentifier  
**Deskripsi alarm: ** Alarm saat jeda replika binlog Aurora menunjukkan status kesalahan.  
**Maksud: ** Mendeteksi kesalahan replikasi instance penulis.  
**Kriteria PromQL: ** `avg({__name__="AuroraBinlogReplicaLag", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= -1`  
**Ambang yang disarankan: ** -1 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** -1 menunjukkan keadaan kesalahan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 120  
**Periode pemulihan: ** 120

**BlockedTransactions**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat jumlah transaksi yang diblokir melebihi ambang batas untuk instance RDS.  
**Maksud: Men ** deteksi pemblokiran transaksi yang menyebabkan penurunan kinerja.  
**Kriteria PromQL: ** `avg({__name__="BlockedTransactions", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan jumlah transaksi yang diblokir yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**BufferCacheHitRatio**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat rasio hit cache buffer turun di bawah 80% untuk instance RDS.  
**Maksud: ** Mendeteksi efisiensi cache rendah yang menyebabkan penurunan kinerja.  
**Kriteria PromQL: ** `avg({__name__="BufferCacheHitRatio", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) < 80`  
**Ambang batas yang disarankan: ** 80 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** bawah 80% menunjukkan disk yang berlebihan I/O.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 600  
**Periode pemulihan: ** 600

**EngineUptime**  
**Label: ** DBClusterIdentifier  
**Deskripsi alarm: ** Alarm saat waktu aktif mesin turun ke nol menunjukkan restart penulis Aurora.  
**Maksud: ** Mendeteksi waktu henti atau crash instans penulis Aurora.  
**Kriteria PromQL: ** `avg({__name__="EngineUptime", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) <= 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: Waktu aktif ** nol menunjukkan restart instance.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 120  
**Periode pemulihan: ** 120

**RollbackSegmentHistoryListLength**  
**Label: ** DBInstanceIdentifier  
**Deskripsi alarm: ** Alarm saat panjang daftar riwayat segmen rollback melebihi 1 juta untuk instance Aurora.  
**Maksud: Men ** deteksi riwayat rollback tinggi yang menyebabkan degradasi CPU.  
**Kriteria PromQL: ** `avg({__name__="RollbackSegmentHistoryListLength", "@instrumentation.@name"="cloudwatch.aws/rds", DBInstanceIdentifier="DB"}) > 1000000`  
**Ambang yang disarankan: ** 1000000 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 1M menyebabkan masalah kinerja.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**StorageNetworkThroughput**  
**Label: ** DBClusterIdentifier  
**Deskripsi alarm: ** Alarm saat throughput jaringan penyimpanan melebihi ambang batas untuk cluster Aurora.  
**Maksud: ** Mendeteksi throughput tinggi yang berisiko jatuh paket jaringan.  
**Kriteria PromQL: ** `avg({__name__="StorageNetworkThroughput", "@instrumentation.@name"="cloudwatch.aws/rds", DBClusterIdentifier="CLUSTER"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kapasitas jaringan instance.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## Route 53
<a name="Recommended_PromQL_Route53"></a>

**HealthCheckStatus**  
**Label: ** HealthCheckId  
**Deskripsi alarm: ** Alarm saat pemeriksaan kesehatan Route 53 melaporkan titik akhir yang tidak sehat.  
**Maksud: ** Mendeteksi titik akhir yang tidak sehat dengan menggunakan pemeriksa kesehatan Route 53.  
**Kriteria PromQL: ** `avg({__name__="HealthCheckStatus", "@instrumentation.@name"="cloudwatch.aws/route53", HealthCheckId="HC"}) < 1`  
**Ambang batas yang disarankan: ** 1 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** bawah 1 menunjukkan titik akhir gagal dalam pemeriksaan kesehatan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 180  
**Periode pemulihan: ** 180

## S3
<a name="Recommended_PromQL_S3"></a>

**4xxErrors**  
**Label: **BucketName, FilterId  
**Deskripsi alarm: ** Alarm saat tingkat kesalahan 4xx melebihi 5% untuk bucket S3.  
**Maksud: ** Mendeteksi tingkat kesalahan klien yang tidak normal.  
**Kriteria PromQL: ** `avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 5% menunjukkan masalah pengaturan atau akses.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**5xxErrors**  
**Label: **BucketName, FilterId  
**Deskripsi alarm: ** Alarm saat tingkat kesalahan 5xx melebihi 5% untuk bucket S3.  
**Maksud: ** Mendeteksi kesalahan sisi server yang mempengaruhi aplikasi.  
**Kriteria PromQL: ** `avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3", BucketName="BUCKET",FilterId="FILTER"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 5% menunjukkan masalah layanan S3.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**OperationsFailedReplication**  
**Label: **SourceBucket, DestinationBucket, RuleId  
**Deskripsi alarm: ** Alarm saat operasi replikasi S3 gagal untuk bucket.  
**Maksud: Men ** deteksi kegagalan replikasi yang mempertaruhkan inkonsistensi data.  
**Kriteria PromQL: ** `max({__name__="OperationsFailedReplication", "@instrumentation.@name"="cloudwatch.aws/s3", SourceBucket="SRC",DestinationBucket="DST",RuleId="RULE"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap replikasi yang gagal memerlukan penyelidikan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## S3 Object Lambda
<a name="Recommended_PromQL_S3ObjectLambda"></a>

**4xxErrors**  
**Label: **AccessPointName, DataSource ARN  
**Deskripsi alarm: ** Alarm saat tingkat kesalahan 4xx melebihi 5% untuk titik akses Lambda Objek S3.  
**Maksud: ** Mendeteksi tingkat kesalahan klien abnormal untuk Object Lambda.  
**Kriteria PromQL: ** `avg({__name__="4xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 5% menunjukkan masalah pengaturan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**5xxErrors**  
**Label: **AccessPointName, DataSource ARN  
**Deskripsi alarm: ** Alarm saat tingkat kesalahan 5xx melebihi 5% untuk titik akses Lambda Objek S3.  
**Maksud: Men ** deteksi kesalahan sisi server di Object Lambda.  
**Kriteria PromQL: ** `avg({__name__="5xxErrors", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 5% menunjukkan masalah Lambda atau S3.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**LambdaResponse4xx**  
**Label: **AccessPointName, DataSource ARN  
**Deskripsi alarm: ** Alarm ketika tingkat respons fungsi Lambda 4xx melebihi 5% untuk titik akses Lambda Objek S3.  
**Maksud: ** Mendeteksi kesalahan klien fungsi Lambda.  
**Kriteria PromQL: ** `avg({__name__="LambdaResponse4xx", "@instrumentation.@name"="cloudwatch.aws/s3objectlambda", AccessPointName="AP",DataSourceARN="ARN"}) > 0.05`  
**Ambang batas yang disarankan: ** 0,05 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** atas 5% menunjukkan masalah fungsi Lambda.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

## SNS
<a name="Recommended_PromQL_SNS"></a>

**NumberOfMessagesPublished**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat jumlah pesan yang dipublikasikan turun di bawah ambang batas untuk topik SNS.  
**Maksud: ** Mendeteksi penurunan volume penerbitan yang signifikan.  
**Kriteria PromQL: ** `sum({__name__="NumberOfMessagesPublished", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan lalu lintas minimum yang diharapkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**NumberOfNotificationsDelivered**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat jumlah notifikasi yang dikirimkan turun di bawah ambang batas untuk topik SNS.  
**Maksud: ** Mendeteksi penurunan volume pengiriman notifikasi.  
**Kriteria PromQL: ** `sum({__name__="NumberOfNotificationsDelivered", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan pengiriman minimum yang diharapkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**NumberOfNotificationsFailed**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat jumlah pengiriman notifikasi gagal melebihi ambang batas untuk topik SNS.  
**Maksud: ** Mendeteksi kegagalan pengiriman.  
**Kriteria PromQL: ** `sum({__name__="NumberOfNotificationsFailed", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat kegagalan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**NumberOfNotificationsFilteredOut-InvalidAttributes**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat notifikasi disaring karena atribut pesan yang tidak valid.  
**Maksud: ** Mendeteksi atribut pesan yang tidak valid.  
**Kriteria PromQL: ** `sum({__name__="NumberOfNotificationsFilteredOut-InvalidAttributes", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap filter yang tidak valid menunjukkan kesalahan konfigurasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**NumberOfNotificationsFilteredOut-InvalidMessageBody**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat notifikasi disaring karena badan pesan yang tidak valid.  
**Maksud: ** Mendeteksi badan pesan yang tidak valid.  
**Kriteria PromQL: ** `sum({__name__="NumberOfNotificationsFilteredOut-InvalidMessageBody", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap filter yang tidak valid menunjukkan kesalahan konfigurasi.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**NumberOfNotificationsRedrivenToDlq**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat pemberitahuan dikirim ke antrian huruf mati untuk topik SNS.  
**Maksud: ** Mendeteksi pesan yang dikirim ke antrean surat mati.  
**Kriteria PromQL: ** `sum({__name__="NumberOfNotificationsRedrivenToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: ** Setiap pesan DLQ menunjukkan masalah pengiriman.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**NumberOfNotificationsFailedToRedriveToDlq**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat notifikasi gagal dikirim ke antrian huruf mati untuk topik SNS.  
**Maksud: ** Mendeteksi kegagalan pengiriman DLQ.  
**Kriteria PromQL: ** `sum({__name__="NumberOfNotificationsFailedToRedriveToDlq", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: DLQ ** gagal berarti pelacakan kesalahan hilang.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**SMSMonthToDateSpentUSD**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat pengeluaran SMS mendekati kuota akun untuk topik SNS.  
**Maksud: Men ** deteksi pengeluaran SMS mendekati kuota.  
**Kriteria PromQL: ** `max({__name__="SMSMonthToDateSpentUSD", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kuota SMS akun.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

**SMSSuccessRate**  
**Label: ** TopicName  
**Deskripsi alarm: ** Alarm saat tingkat keberhasilan pengiriman SMS turun di bawah ambang batas untuk topik SNS.  
**Maksud: ** Mendeteksi pengiriman SMS yang gagal.  
**Kriteria PromQL: ** `avg({__name__="SMSSuccessRate", "@instrumentation.@name"="cloudwatch.aws/sns", TopicName="TOPIC"}) < {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan tingkat pengiriman yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 300  
**Periode pemulihan: ** 300

## SQS
<a name="Recommended_PromQL_SQS"></a>

**ApproximateAgeOfOldestMessage**  
**Label: ** QueueName  
**Deskripsi alarm: ** Alarm saat usia pesan tertua melebihi ambang batas untuk antrian SQS.  
**Maksud: ** Mendeteksi pesan yang tidak diproses cukup cepat.  
**Kriteria PromQL: ** `max({__name__="ApproximateAgeOfOldestMessage", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan waktu pemrosesan pesan yang dapat diterima.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**ApproximateNumberOfMessagesNotVisible**  
**Label: ** QueueName  
**Deskripsi alarm: ** Alarm saat jumlah pesan dalam penerbangan melebihi ambang batas untuk antrian SQS.  
**Maksud: ** Mendeteksi pesan dalam penerbangan yang tinggi yang menunjukkan masalah konsumen.  
**Kriteria PromQL: ** `avg({__name__="ApproximateNumberOfMessagesNotVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan volume pemrosesan yang diharapkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**ApproximateNumberOfMessagesVisible**  
**Label: ** QueueName  
**Deskripsi alarm: ** Alarm saat jumlah pesan yang terlihat melebihi ambang batas untuk antrian SQS.  
**Maksud: ** Mendeteksi backlog pesan yang menunjukkan konsumen lambat.  
**Kriteria PromQL: ** `avg({__name__="ApproximateNumberOfMessagesVisible", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) > {{THRESHOLD}}`  
**Ambang batas yang disarankan: ** {{THRESHOLD}} (tertanam dalam kueri)  
**Pembenaran ambang batas: Tet ** apkan berdasarkan kedalaman antrian yang diharapkan.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**NumberOfMessagesSent**  
**Label: ** QueueName  
**Deskripsi alarm: ** Alarm saat tidak ada pesan yang dikirim ke antrian SQS.  
**Maksud: ** Mendeteksi produsen berhenti mengirim pesan.  
**Kriteria PromQL: ** `sum({__name__="NumberOfMessagesSent", "@instrumentation.@name"="cloudwatch.aws/sqs", QueueName="QUEUE"}) <= 0`  
**Ambang batas yang disarankan: ** 0 (tertanam dalam kueri)  
**Pembenaran ambang batas: Pesan ** nol menunjukkan kegagalan produsen.  
**Interval evaluasi: ** 60  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

## VPN
<a name="Recommended_PromQL_VPN"></a>

**TunnelState (Tingkat VPN) **  
**Label: ** VpnId  
**Deskripsi alarm: ** Alarm saat setidaknya satu terowongan VPN dalam keadaan DOWN.  
**Maksud: ** Mendeteksi setidaknya satu terowongan dalam keadaan DOWN.  
**Kriteria PromQL: ** `min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", VpnId="VPN"}) < 1`  
**Ambang batas yang disarankan: ** 1 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** bawah 1 berarti terowongan turun.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900

**TunnelState (Tingkat terowongan) **  
**Label: ** TunnelIpAddress  
**Deskripsi alarm: ** Alarm saat terowongan VPN tertentu dalam keadaan DOWN.  
**Maksud: ** Mendeteksi terowongan tertentu dalam keadaan DOWN.  
**Kriteria PromQL: ** `min({__name__="TunnelState", "@instrumentation.@name"="cloudwatch.aws/vpn", TunnelIpAddress="IP"}) < 1`  
**Ambang batas yang disarankan: ** 1 (tertanam dalam kueri)  
**Pembenaran ambang batas: Di ** bawah 1 berarti terowongan turun.  
**Interval evaluasi: ** 300  
**Periode tertunda: ** 900  
**Periode pemulihan: ** 900