View a markdown version of this page

OpenTelemetry referensi metrik - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

OpenTelemetry referensi metrik

Bagian ini memberikan daftar lengkap (tidak lengkap) OpenTelemetry metrik yang dipancarkan oleh observabilitas terperinci Amazon SageMaker AI dan tersedia di AI Insights. SageMaker

OpenTelemetry label metrik

OpenTelemetry metrik mencakup label (atribut) yang mengidentifikasi sumber daya yang terkait dengan setiap titik data. Gunakan label ini untuk memfilter dan mengelompokkan metrik dalam kueri.

OpenTelemetry label Deskripsi
aws.sagemaker.endpoint.name Nama titik akhir
aws.sagemaker.variant.name Nama varian produksi
aws.sagemaker.inference_component.name Nama komponen inferensi
@resource.host.id ID contoh EC2
aws.sagemaker.container.id ID Kontainer
@resource.cloud.availability_zone Zona ketersediaan
@resource.host.type Tipe instans

Account-level metrik agregat

Metrik ini berada di tingkat akun.

# Metrik Deskripsi
1 TotalEndpoints Jumlah total titik akhir aktif di akun
2 TotalICs Jumlah total komponen inferensi yang digunakan di semua titik akhir
3 TotalInvocations Jumlah total permintaan inferensi di semua titik akhir

Metrik GPU (DCGM)

Metrik ini dikumpulkan dari eksportir Data Center GPU Manager (DCGM) dan tersedia di semua titik akhir GPU terlepas dari kerangka inferensi.

Dapat digabungkan pada komponen inferensi, instance, atau tingkat titik akhir.

# Metrik Metrik sumber Deskripsi
4 Pemanfaatan GPU (%) DCGM_FI_DEV_GPU_UTIL Persentase waktu GPU aktif mengeksekusi beban kerja
5 Pemanfaatan memori GPU (%) DCGM_FI_DEV_MEM_COPY_UTIL Persentase waktu pengontrol memori secara aktif memindahkan data ke atau dari memori GPU

Metrik simpul (contoh)

Metrik ini dikumpulkan dari pengekspor node dan memberikan visibilitas tingkat instance ke CPU, memori, dan pemanfaatan disk.

Dapat digabungkan pada tingkat instance atau titik akhir.

# Metrik Metrik sumber Deskripsi
6 Pemanfaatan CPU (%) node_cpu_seconds_total Penghitung kumulatif mengukur total detik CPU yang dihabiskan di setiap mode eksekusi (idle, pengguna, sistem, iowait) sejak boot. Turunkan persentase pemanfaatan dari tingkat mode idle.
7 Pemanfaatan memori (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes Persentase memori fisik yang digunakan. Berasal dari total memori dikurangi memori yang tersedia.
8 Pemanfaatan disk (%) node_filesystem_avail_bytes, node_filesystem_size_bytes Persentase ruang sistem file yang digunakan. Berasal dari ukuran total dikurangi ruang yang tersedia.

Metrik kerangka inferensi (Vllm/SGLang)

Metrik kerangka inferensi dipancarkan secara native oleh mesin penyajian yang berjalan di dalam wadah model Anda. SageMaker AI secara otomatis mengumpulkan metrik ini dari kerangka kerja yang didukung (VllM dan SGLang) saat pengamatan terperinci diaktifkan. Metrik ini memberikan visibilitas ke throughput token, latensi, tekanan cache KV, dan antrian permintaan pada tingkat komponen inferensi.

Metrik ini dapat dikaitkan pada titik akhir, komponen inferensi, atau tingkat instance.

# Metrik Metrik sumber Deskripsi
9 Masukan Token Per Detik vllm:prompt_tokens_total Jumlah total token prompt yang diproses per detik
10 Token Output Per Detik vllm:generation_tokens_total Jumlah total token yang dihasilkan per detik
11 Jumlah TPS Berasal dari #9 + #10 Token input dan output gabungan per detik
12 Pemanfaatan TPS% Berasal dari #11 Throughput token saat ini sebagai persentase dari puncak yang diamati
13 TTFT vllm:time_to_first_token_seconds Waktu dari kedatangan permintaan ke token yang dihasilkan pertama (histogram)
14 Inter-Token Latensi vllm:inter_token_latency_seconds Waktu rata-rata antara token yang dihasilkan berturut-turut (histogram)
15 Pemanfaatan Cache KV vllm:gpu_cache_usage_perc Persentase KV-cache memori GPU yang saat ini digunakan
16 Kedalaman Antrian vllm:num_requests_waiting Jumlah permintaan yang menunggu dalam antrian untuk diproses
17 Ukuran Batch vllm:num_requests_running Jumlah permintaan yang sedang berjalan (dalam penerbangan)
18 Latensi Model vllm:e2e_request_latency_seconds End-to-end meminta latensi dari kedatangan ke token akhir (histogram)
catatan

Metrik diawali dengan vllm: memiliki sglang: rekan setara untuk titik akhir SGLang.

Operations-driven metrik

Metrik ini didorong oleh peristiwa dan dipancarkan oleh operasi Buat, Perbarui, atau Skala Anda ke komponen titik akhir atau inferensi. Mereka tidak terpengaruh olehMetricPublishFrequencyInSeconds.

Metrik ini dapat dikaitkan pada titik akhir dan tingkat komponen inferensi.

# Metrik Metrik sumber Deskripsi
19 Acara Penskalaan e2e_duration Menunjukkan bahwa tindakan penskalaan otomatis atau penskalaan manual terjadi di titik akhir Anda. Filter berdasarkan label aws.sagemaker.scaling.direction (ScaleOutatauScaleIn) untuk mengidentifikasi arah.
20 Latensi Penskalaan E2E e2e_duration End-to-end durasi penskalaan dari pemicu hingga penyelesaian (detik). Filter berdasarkan label aws.sagemaker.operation.type (misalnya,UpdateWCEndpoint).
21 Hitungan ICE ice_count Jumlah kejadian Kesalahan Kapasitas Tidak Cukup per AZ per jenis instans
22 Jenis Acara Penyeimbangan Kembali rebalancing_blocked Jenis acara penyeimbangan kembali dan kondisinya saat ini
23 Durasi Penyeimbangan Kembali rebalancing_duration Durasi penyeimbangan kembali dari awal hingga selesai (detik)
24 Salinan IC Dipindahkan ic_copy_moved Jumlah salinan komponen inferensi yang dipindahkan selama penyeimbangan kembali
25 Instans Dirilis instances_released Jumlah instans EC2 yang dibebaskan oleh konsolidasi selama penyeimbangan kembali
26 Durasi Unduhan Model model_download_time Saatnya mengunduh artefak model dari S3 ke instance (detik)
27 Durasi Beban GPU gpu_load_time Waktu untuk memuat bobot model ke dalam memori GPU (detik)
28 Durasi Mulai Kontainer container_start_time Waktu dari kontainer mulai melewati pemeriksaan kesehatan (detik)

Metrik penempatan armada turunan

Selain metrik yang tercantum di atas, dasbor SageMaker AI Insights menghitung metrik yang diturunkan dari data penempatan bidang kontrol. Ini adalah tampilan agregat yang terlihat di dasbor dan bukan nama metrik yang dapat dikueri secara individual di Amazon CloudWatch Query Studio.

Metrik penempatan armada turunan meliputi:

  • Jumlah instans per zona ketersediaan

  • Jumlah salinan IC per zona ketersediaan

  • AZ skew (persentase ketidakseimbangan distribusi di seluruh armada Anda)

  • Salinan IC per instance

Nilai-nilai ini terlihat di tab Keandalan dasbor SageMaker AI Insights.