Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Siapkan kolektor Prometheus terkelola untuk Amazon MSK
Untuk menggunakan kolektor Amazon Managed Service for Prometheus, Anda membuat scraper yang menemukan dan menarik metrik di Amazon Managed Streaming untuk cluster Apache Kafka Anda. Anda juga dapat membuat scraper yang terintegrasi dengan Amazon Elastic Kubernetes Service atau dengan Amazon Service. OpenSearch Untuk informasi selengkapnya, lihat Meng integrasikan Amazon EKS dan Mengintegrasikan OpenSearch Layanan Amazon.
Buat scraper
Kolektor Amazon Managed Service for Prometheus terdiri dari scraper yang menemukan dan mengumpulkan metrik dari cluster Amazon MSK. Amazon Managed Service for Prometheus mengelola scraper untuk Anda, memberi Anda skalabilitas, keamanan, dan keandalan yang Anda butuhkan, tanpa harus mengelola instans, agen, atau pencakar sendiri.
Anda dapat membuat scraper menggunakan AWS API atau AWS CLI seperti yang dijelaskan dalam prosedur berikut.
Ada beberapa prasyarat untuk membuat scraper Anda sendiri:
-
Anda harus membuat cluster Amazon MSK.
-
Konfigurasikan grup keamanan cluster Amazon MSK Anda untuk mengizinkan lalu lintas masuk pada port 11001 (JMX Exporter) dan 11002 (Eksportir Node) dalam Amazon VPC Anda, karena scraper memerlukan akses ke catatan DNS ini untuk mengumpulkan metrik Prometheus.
-
Amazon VPC tempat cluster Amazon MSK berada harus mengaktifkan DNS.
catatan
Cluster akan dikaitkan dengan scraper dengan nama sumber daya Amazon (ARN). Jika Anda menghapus cluster, dan kemudian membuat yang baru dengan nama yang sama, ARN akan digunakan kembali untuk cluster baru. Karena itu, scraper akan mencoba mengumpulkan metrik untuk cluster baru. Anda menghapus pencakar secara terpisah dari menghapus cluster.
-
Berikut ini adalah daftar lengkap operasi scraper yang dapat Anda gunakan dengan AWS API:
Buat scraper dengan operasi CreateScraper API.
-
Buat daftar pencakar yang ada dengan operasi ListScrapers API.
-
Perbarui alias, konfigurasi, atau tujuan scraper dengan operasi UpdateScraper API.
-
Hapus scraper dengan operasi DeleteScraper API.
-
Dapatkan detail selengkapnya tentang scraper dengan operasi DescribeScraper API.
Cross-account penyiapan
Untuk membuat scraper dalam pengaturan lintas akun saat cluster Amazon MSK tempat Anda ingin mengumpulkan metrik berada di akun yang berbeda dari kolektor Amazon Managed Service for Prometheus, gunakan prosedur di bawah ini.
Misalnya, jika Anda memiliki dua akun, akun sumber pertama account_id_source tempat Amazon MSK berada, dan akun target kedua account_id_target tempat ruang kerja Amazon Managed Service for Prometheus berada.
Untuk membuat scraper dalam pengaturan lintas akun
-
Di akun sumber, buat peran
arn:aws:iam::dan tambahkan kebijakan kepercayaan berikut.111122223333:role/Source{ "Effect": "Allow", "Principal": { "Service": [ "scraper.aps.amazonaws.com" ] }, "Action": "sts:AssumeRole", "Condition": { "ArnEquals": { "aws:SourceArn": "arn:aws:aps:aws-region:111122223333:scraper/scraper-id" }, "StringEquals": { "AWS:SourceAccount": "111122223333" } } } -
Pada setiap kombinasi sumber (cluster Amazon MSK) dan target (Amazon Managed Service untuk ruang kerja Prometheus), Anda perlu membuat peran
arn:aws:iam::dan menambahkan kebijakan kepercayaan berikut dengan izin untuk. AmazonPrometheusRemoteWriteAccess444455556666:role/Target{ "Effect": "Allow", "Principal": { "AWS": "arn:aws:iam::111122223333:role/Source" }, "Action": "sts:AssumeRole", "Condition": { "StringEquals": { "sts:ExternalId": "arn:aws:aps:aws-region:111122223333:scraper/scraper-id" } } } -
Buat scraper dengan
--role-configurationopsi.aws amp create-scraper \ --source vpcConfiguration="{subnetIds=[subnet-subnet-id], "securityGroupIds": ["sg-security-group-id"]}" \ --scrape-configuration configurationBlob=<base64-encoded-blob>\ --destination ampConfiguration="{workspaceArn='arn:aws:aps:aws-region:444455556666:workspace/ws-workspace-id'}"\ --role-configuration '{"sourceRoleArn":"arn:aws:iam::111122223333:role/Source", "targetRoleArn":"arn:aws:iam::444455556666:role/Target"}' -
Validasi pembuatan scraper.
aws amp list-scrapers { "scrapers": [ { "scraperId": "s-example123456789abcdef0", "arn": "arn:aws:aps:aws-region:111122223333:scraper/s-example123456789abcdef0": "arn:aws:iam::111122223333:role/Source", "status": "ACTIVE", "creationTime": "2025-10-27T18:45:00.000Z", "lastModificationTime": "2025-10-27T18:50:00.000Z", "tags": {}, "statusReason": "Scraper is running successfully", "source": { "vpcConfiguration": { "subnetIds": ["subnet-subnet-id"], "securityGroupIds": ["sg-security-group-id"] } }, "destination": { "ampConfiguration": { "workspaceArn": "arn:aws:aps:aws-region:444455556666:workspace/ws-workspace-id'" } }, "scrapeConfiguration": { "configurationBlob": "<base64-encoded-blob>" } } ] }
Mengubah antara RoleConfiguration dan peran terkait layanan
Saat Anda ingin beralih kembali ke peran terkait layanan alih-alih menulis RoleConfiguration ke ruang kerja Layanan Terkelola Amazon untuk Prometheus, Anda harus memperbarui UpdateScraper dan menyediakan ruang kerja di akun yang sama dengan scraper tanpa. RoleConfiguration Ini RoleConfiguration akan dihapus dari scraper dan peran terkait layanan akan digunakan.
Saat Anda mengubah ruang kerja di akun yang sama dengan scraper dan Anda ingin terus menggunakannyaRoleConfiguration, Anda harus menyediakan lagi aktifRoleConfiguration. UpdateScraper
Temukan dan hapus pencakar
Anda dapat menggunakan AWS API atau AWS CLI untuk membuat daftar pencakar di akun Anda atau untuk menghapusnya.
catatan
Pastikan Anda menggunakan versi terbaru dari AWS CLI atau SDK. Versi terbaru memberi Anda fitur dan fungsionalitas terbaru, serta pembaruan keamanan. Atau, gunakan AWS CloudShell, yang menyediakan pengalaman baris perintah yang selalu terkini, secara otomatis.
Untuk membuat daftar semua pencakar di akun Anda, gunakan operasi ListScrapers API.
Atau, dengan AWS CLI, hubungi:
aws amp list-scrapers
ListScrapersmengembalikan semua pencakar di akun Anda, misalnya:
{ "scrapers": [ { "scraperId": "s-1234abcd-56ef-7890-abcd-1234ef567890", "arn": "arn:aws:aps:aws-region:123456789012:scraper/s-1234abcd-56ef-7890-abcd-1234ef567890", "roleArn": "arn:aws:iam::123456789012:role/aws-service-role/AWSServiceRoleForAmazonPrometheusScraper_1234abcd-2931", "status": { "statusCode": "DELETING" }, "createdAt": "2023-10-12T15:22:19.014000-07:00", "lastModifiedAt": "2023-10-12T15:55:43.487000-07:00", "tags": {}, "source": { "vpcConfiguration": { "securityGroupIds": [ "sg-1234abcd5678ef90" ], "subnetIds": [ "subnet-abcd1234ef567890", "subnet-1234abcd5678ab90" ] } }, "destination": { "ampConfiguration": { "workspaceArn": "arn:aws:aps:aws-region:123456789012:workspace/ws-1234abcd-5678-ef90-ab12-cdef3456a78" } } } ] }
Untuk menghapus scraper, scraperId cari scraper yang ingin Anda hapus, gunakan ListScrapers operasi, lalu gunakan DeleteScraper operasi untuk menghapusnya.
Atau, dengan AWS CLI, hubungi:
aws amp delete-scraper --scraper-idscraperId
Metrik yang dikumpulkan dari Amazon MSK
Saat Anda mengintegrasikan dengan Amazon MSK, pengumpul Amazon Managed Service for Prometheus secara otomatis mengikis metrik berikut:
| Metrik | Deskripsi/Tujuan |
|---|---|
|
jmx_config_reload_failure_total |
Jumlah total kali eksportir JMX gagal memuat ulang file konfigurasinya. |
|
jmx_scrape_durasi_second |
Waktu yang dibutuhkan untuk mengikis metrik JMX dalam hitungan detik untuk siklus pengumpulan saat ini. |
|
jmx_scrape_error |
Menunjukkan apakah terjadi kesalahan selama pengikisan metrik JMX (1 = kesalahan, 0 = sukses). |
|
java_lang_ Memory_HeapMemoryUsage_used |
Jumlah memori heap (dalam byte) yang saat ini digunakan oleh JVM. |
|
java_lang_ Memory_HeapMemoryUsage_max |
Jumlah maksimum memori heap (dalam byte) yang dapat digunakan untuk manajemen memori. |
|
java_lang_ Memory_NonHeapMemoryUsage_used |
Jumlah memori non-heap (dalam byte) yang saat ini digunakan oleh JVM. |
|
kafka_cluster_ Partition_Value |
Status atau nilai saat ini terkait dengan partisi cluster Kafka, dipecah berdasarkan ID partisi dan topik. |
|
kafka_konsumen_koordinator_metrik_partisi_yang ditugaskan |
Jumlah partisi yang saat ini ditetapkan untuk konsumen ini. |
|
kafka_konsumen_koordinator_metrik_komit_latency_avg |
Rata-rata waktu yang dibutuhkan untuk melakukan offset dalam milidetik. |
|
kafka_konsumen_koordinator_metrik_rata_komit_konsumen_kafka_ |
Jumlah commit offset per detik. |
|
kafka_konsumen_koordinator_metrik_gagal_rebalance_total |
Jumlah total kelompok konsumen yang gagal menyeimbangkan kembali. |
|
kafka_konsumen_koordinator_metrik_last_heartbeat_detik_lalu |
Jumlah detik sejak detak jantung terakhir dikirim ke koordinator. |
|
kafka_konsumen_koordinator_metrik_rebalance_latency_avg |
Rata-rata waktu yang dibutuhkan untuk menyeimbangkan kembali kelompok konsumen dalam milidetik. |
|
kafka_konsumen_koordinator_metrik_rebalance_total |
Jumlah total kelompok konsumen yang menyeimbangkan kembali. |
|
kafka_konsumen_pengambilan_manager_metrik_bytes_konsum_rata_konsum_ |
Jumlah rata-rata byte yang dikonsumsi per detik oleh konsumen. |
|
kafka_konsumen_konsumen_fetch_manager_metrics_fetch_latency_avg |
Rata-rata waktu yang dibutuhkan untuk permintaan pengambilan dalam milidetik. |
|
kafka_konsumen_konsumen_fetch_manager_metric_fetch_rate |
Jumlah permintaan pengambilan per detik. |
|
kafka_konsumen_pengambilan_manager_metrik_catatan_konsumsi_rata_konsumsi |
Jumlah rata-rata catatan yang dikonsumsi per detik. |
|
kafka_consumer_fetch_manager_metrics_records_lag_max |
Jeda maksimum dalam hal jumlah catatan untuk partisi apa pun di konsumen ini. |
|
kafka_konsumen_metrik_koneksi_hitung_koneksi_konsumen |
Jumlah koneksi aktif saat ini. |
|
kafka_konsumen_metrik_masuk_byte_tingkat masukan_konsumen |
Rata-rata jumlah byte yang diterima per detik dari semua server. |
|
kafka_konsumen_metrik_konsumen_last_poll_detik_lalu |
Jumlah detik sejak panggilan jajak pendapat konsumen terakhir (). |
|
kafka_konsumen_metrik_perminta_rata_perminta_konsumen_ |
Jumlah permintaan yang dikirim per detik. |
|
kafka_konsumen_metrik_rata_response_rata_tanggap_konsumen |
Jumlah tanggapan yang diterima per detik. |
|
kafka_group_konsumen_ _Nilai ConsumerLagMetrics |
Nilai keterlambatan konsumen saat ini untuk kelompok konsumen, menunjukkan seberapa jauh di belakang konsumen. |
|
kafka_controller_ _Nilai KafkaController |
Status atau nilai pengontrol Kafka saat ini (1 = pengontrol aktif, 0 = tidak aktif). |
|
kafka_controller_ _Hitung ControllerEventManager |
Jumlah total peristiwa pengontrol yang diproses. |
|
kafka_controller_ _berarti ControllerEventManager |
Rata-rata (rata-rata) waktu yang dibutuhkan untuk memproses peristiwa pengontrol. |
|
kafka_pengontrol_ _ ControllerStats MeanRate |
Tingkat rata-rata operasi statistik pengontrol per detik. |
|
kafka_koordinator_grup_ _Nilai GroupMetadataManager |
Status atau nilai pengelola metadata grup saat ini untuk grup konsumen. |
|
kafka_log_ _Hitung LogFlushStats |
Jumlah total operasi log flush. |
|
kafka_log_ _Berarti LogFlushStats |
Rata-rata (rata-rata) waktu yang dibutuhkan untuk operasi log flush. |
|
kafka_log_ LogFlushStats MeanRate |
Tingkat rata-rata operasi log flush per detik. |
|
kafka_network_ _Hitung RequestMetrics |
Jumlah total permintaan jaringan yang diproses. |
|
kafka_network_ _berarti RequestMetrics |
Rata-rata (rata-rata) waktu yang dibutuhkan untuk memproses permintaan jaringan. |
|
kafka_jaringan_ _ RequestMetrics MeanRate |
Tingkat rata-rata permintaan jaringan per detik. |
|
kafka_jaringan_ Acceptor_MeanRate |
Tingkat rata-rata koneksi yang diterima per detik. |
|
kafka_server_ Fetch_queue_size |
Ukuran antrian permintaan pengambilan saat ini. |
|
kafka_server_ Produce_queue_size |
Ukuran antrian permintaan produksi saat ini. |
|
kafka_server_ Request_queue_size |
Ukuran saat ini dari antrian permintaan umum. |
|
kafka_server_ _Hitung BrokerTopicMetrics |
Jumlah total operasi topik broker (pesan in/out, byte in/out). |
|
kafka_server_ _ BrokerTopicMetrics MeanRate |
Tingkat rata-rata operasi topik broker per detik. |
|
kafka_server_ _ BrokerTopicMetrics OneMinuteRate |
One-minute tingkat rata-rata bergerak dari operasi topik broker. |
|
kafka_server_ _Nilai DelayedOperationPurgatory |
Jumlah operasi yang tertunda saat ini di api penyucian (menunggu untuk diselesaikan). |
|
kafka_server_ _ DelayedFetchMetrics MeanRate |
Tingkat rata-rata operasi pengambilan tertunda per detik. |
|
kafka_server_ _Nilai FetcherLagMetrics |
Nilai lag saat ini untuk utas pengambil replika (seberapa jauh di belakang pemimpin). |
|
kafka_server_ _ FetcherStats MeanRate |
Tingkat rata-rata operasi fetcher per detik. |
|
kafka_server_ _Nilai ReplicaManager |
Status atau nilai manajer replika saat ini. |
|
kafka_server_ _ ReplicaManager MeanRate |
Tingkat rata-rata operasi manajer replika per detik. |
|
kafka_server_ _byte_rate LeaderReplication |
Tingkat byte yang direplikasi per detik untuk partisi di mana broker ini adalah pemimpin. |
|
kafka_server_group_koordinator_metrik_group_completed_rebalance_count |
Jumlah total rebalance kelompok konsumen yang diselesaikan. |
|
kafka_server_grup_koordinator_metrik_offset_comit_count |
Jumlah total operasi komit offset. |
|
kafka_server_grup_koordinator_metrik_offset_komite_rate |
Tingkat operasi komit offset per detik. |
|
kafka_server_socket_server_metrics_connection_count |
Jumlah koneksi aktif saat ini. |
|
kafka_server_socket_server_metrics_connection_rate_creation_rate |
Tingkat pembuatan koneksi baru per detik. |
|
kafka_server_socket_server_metrics_connection_close_rate |
Tingkat penutupan koneksi per detik. |
|
kafka_server_socket_server_metrik_gagal_autentikasi total |
Jumlah total upaya otentikasi yang gagal. |
|
kafka_server_socket_server_metrik_incoming_byte_rate |
Tingkat byte masuk per detik. |
|
kafka_server_socket_server_metrik_outgoing_byte_rate |
Tingkat byte keluar per detik. |
|
kafka_server_socket_server_metric_rate_request_rate |
Tingkat permintaan per detik. |
|
kafka_server_socket_server_metric_rate_response_rate |
Tingkat respons per detik. |
|
kafka_server_socket_server_metrics_network_io_rate |
Tingkat I/O operasi jaringan per detik. |
|
kafka_server_socket_server_metric_io_ratio |
Fraksi waktu yang dihabiskan dalam I/O operasi. |
|
kafka_server_controller_channel_metrics_connection_count |
Jumlah koneksi aktif saat ini untuk saluran pengontrol. |
|
kafka_server_controller_channel_metrik_incoming_byte_rate |
Tingkat byte masuk per detik untuk saluran pengontrol. |
|
kafka_server_controller_channel_metrik_outgoing_byte_rate |
Tingkat byte keluar per detik untuk saluran pengontrol. |
|
kafka_server_controller_channel_metric_request_rate |
Tingkat permintaan per detik untuk saluran pengontrol. |
|
kafka_server_replica_fetcher_metrics_connection_count |
Jumlah koneksi aktif saat ini untuk pengambil replika. |
|
kafka_server_replica_fetcher_metrics_incoming_byte_rate |
Tingkat byte masuk per detik untuk replika fetcher. |
|
kafka_server_replica_fetcher_metrics_request_rate |
Tingkat permintaan per detik untuk replika fetcher. |
|
kafka_server_replica_fetcher_metrics_failed_autentika_total |
Jumlah total upaya otentikasi yang gagal untuk pengambil replika. |
|
kafka_server_ _Hitung ZooKeeperClientMetrics |
Jumlah total operasi ZooKeeper klien. |
|
kafka_server_ _Rata-rata ZooKeeperClientMetrics |
Rata-rata latensi operasi ZooKeeper klien. |
|
kafka_server_ _Nilai KafkaServer |
Status atau nilai server Kafka saat ini (biasanya menunjukkan server sedang berjalan). |
|
node_cpu_detik_total |
Total detik yang dihabiskan CPU dalam setiap mode (pengguna, sistem, idle, dll.), Dipecah oleh CPU dan mode. |
|
node_disk_baca_bytes_total |
Jumlah total byte berhasil dibaca dari disk, dipecah berdasarkan perangkat. |
|
node_disk_dibaca_selesai_total |
Jumlah total pembacaan yang berhasil diselesaikan untuk disk, dipecah berdasarkan perangkat. |
|
node_disk_menulis_selesai_total |
Jumlah total penulisan yang berhasil diselesaikan untuk disk, dipecah berdasarkan perangkat. |
|
node_disk_written_byte_total |
Jumlah total byte yang berhasil ditulis ke disk, dipecah berdasarkan perangkat. |
|
node_filesystem_avail_bytes |
Ruang sistem file yang tersedia dalam byte untuk pengguna non-root, dipecah berdasarkan perangkat dan titik pemasangan. |
|
node_filesystem_size_bytes |
Ukuran total sistem file dalam byte, dipecah berdasarkan perangkat dan titik pemasangan. |
|
node_filesystem_free_bytes |
Ruang sistem file bebas dalam byte, dipecah berdasarkan perangkat dan titik pemasangan. |
|
node_filesystem_file_files |
Jumlah total node file (inode) pada sistem file, dipecah berdasarkan perangkat dan titik pemasangan. |
|
node_filesystem_files_free |
Jumlah node file bebas (inode) pada sistem file, dipecah berdasarkan perangkat dan titik pemasangan. |
|
node_filesystem_readonly |
Menunjukkan apakah sistem file dipasang read-only (1 = read-only, 0 = baca-tulis). |
|
node_filesystem_device_error |
Menunjukkan apakah terjadi kesalahan saat mendapatkan statistik sistem file (1 = kesalahan, 0 = sukses). |
Batasan
Integrasi Amazon MSK saat ini dengan Amazon Managed Service for Prometheus memiliki batasan berikut:
-
Hanya didukung untuk cluster Amazon MSK Provisioned (tidak tersedia untuk Amazon MSK Serverless)
-
Tidak didukung untuk cluster Amazon MSK dengan akses publik diaktifkan dalam kombinasi dengan mode metadata Kraft
-
Saat ini mendukung pemetaan 1:1 antara cluster Amazon MSK dan Amazon Managed Service for Prometheus collectors/workspaces