Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
OpenTelemetry referensi metrik
Bagian ini memberikan daftar lengkap (tidak lengkap) OpenTelemetry metrik yang dipancarkan oleh observabilitas terperinci Amazon SageMaker AI dan tersedia di AI Insights. SageMaker
OpenTelemetry label metrik
OpenTelemetry metrik mencakup label (atribut) yang mengidentifikasi sumber daya yang terkait dengan setiap titik data. Gunakan label ini untuk memfilter dan mengelompokkan metrik dalam kueri.
| OpenTelemetry label | Deskripsi |
|---|---|
aws.sagemaker.endpoint.name |
Nama titik akhir |
aws.sagemaker.variant.name |
Nama varian produksi |
aws.sagemaker.inference_component.name |
Nama komponen inferensi |
@resource.host.id |
ID contoh EC2 |
aws.sagemaker.container.id |
ID Kontainer |
@resource.cloud.availability_zone |
Zona ketersediaan |
@resource.host.type |
Tipe instans |
Account-level metrik agregat
Metrik ini berada di tingkat akun.
| # | Metrik | Deskripsi |
|---|---|---|
| 1 | TotalEndpoints |
Jumlah total titik akhir aktif di akun |
| 2 | TotalICs |
Jumlah total komponen inferensi yang digunakan di semua titik akhir |
| 3 | TotalInvocations |
Jumlah total permintaan inferensi di semua titik akhir |
Metrik GPU (DCGM)
Metrik ini dikumpulkan dari eksportir Data Center GPU Manager (DCGM) dan tersedia di semua titik akhir GPU terlepas dari kerangka inferensi.
Dapat digabungkan pada komponen inferensi, instance, atau tingkat titik akhir.
| # | Metrik | Metrik sumber | Deskripsi |
|---|---|---|---|
| 4 | Pemanfaatan GPU (%) | DCGM_FI_DEV_GPU_UTIL |
Persentase waktu GPU aktif mengeksekusi beban kerja |
| 5 | Pemanfaatan memori GPU (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
Persentase waktu pengontrol memori secara aktif memindahkan data ke atau dari memori GPU |
Metrik simpul (contoh)
Metrik ini dikumpulkan dari pengekspor node dan memberikan visibilitas tingkat instance ke CPU, memori, dan pemanfaatan disk.
Dapat digabungkan pada tingkat instance atau titik akhir.
| # | Metrik | Metrik sumber | Deskripsi |
|---|---|---|---|
| 6 | Pemanfaatan CPU (%) | node_cpu_seconds_total |
Penghitung kumulatif mengukur total detik CPU yang dihabiskan di setiap mode eksekusi (idle, pengguna, sistem, iowait) sejak boot. Turunkan persentase pemanfaatan dari tingkat mode idle. |
| 7 | Pemanfaatan memori (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
Persentase memori fisik yang digunakan. Berasal dari total memori dikurangi memori yang tersedia. |
| 8 | Pemanfaatan disk (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
Persentase ruang sistem file yang digunakan. Berasal dari ukuran total dikurangi ruang yang tersedia. |
Metrik kerangka inferensi (Vllm/SGLang)
Metrik kerangka inferensi dipancarkan secara native oleh mesin penyajian yang berjalan di dalam wadah model Anda. SageMaker AI secara otomatis mengumpulkan metrik ini dari kerangka kerja yang didukung (VllM dan SGLang) saat pengamatan terperinci diaktifkan. Metrik ini memberikan visibilitas ke throughput token, latensi, tekanan cache KV, dan antrian permintaan pada tingkat komponen inferensi.
Metrik ini dapat dikaitkan pada titik akhir, komponen inferensi, atau tingkat instance.
| # | Metrik | Metrik sumber | Deskripsi |
|---|---|---|---|
| 9 | Masukan Token Per Detik | vllm:prompt_tokens_total |
Jumlah total token prompt yang diproses per detik |
| 10 | Token Output Per Detik | vllm:generation_tokens_total |
Jumlah total token yang dihasilkan per detik |
| 11 | Jumlah TPS | Berasal dari #9 + #10 | Token input dan output gabungan per detik |
| 12 | Pemanfaatan TPS% | Berasal dari #11 | Throughput token saat ini sebagai persentase dari puncak yang diamati |
| 13 | TTFT | vllm:time_to_first_token_seconds |
Waktu dari kedatangan permintaan ke token yang dihasilkan pertama (histogram) |
| 14 | Inter-Token Latensi | vllm:inter_token_latency_seconds |
Waktu rata-rata antara token yang dihasilkan berturut-turut (histogram) |
| 15 | Pemanfaatan Cache KV | vllm:gpu_cache_usage_perc |
Persentase KV-cache memori GPU yang saat ini digunakan |
| 16 | Kedalaman Antrian | vllm:num_requests_waiting |
Jumlah permintaan yang menunggu dalam antrian untuk diproses |
| 17 | Ukuran Batch | vllm:num_requests_running |
Jumlah permintaan yang sedang berjalan (dalam penerbangan) |
| 18 | Latensi Model | vllm:e2e_request_latency_seconds |
End-to-end meminta latensi dari kedatangan ke token akhir (histogram) |
catatan
Metrik diawali dengan vllm: memiliki sglang: rekan setara untuk titik akhir SGLang.
Operations-driven metrik
Metrik ini didorong oleh peristiwa dan dipancarkan oleh operasi Buat, Perbarui, atau Skala Anda ke komponen titik akhir atau inferensi. Mereka tidak terpengaruh olehMetricPublishFrequencyInSeconds.
Metrik ini dapat dikaitkan pada titik akhir dan tingkat komponen inferensi.
| # | Metrik | Metrik sumber | Deskripsi |
|---|---|---|---|
| 19 | Acara Penskalaan | e2e_duration |
Menunjukkan bahwa tindakan penskalaan otomatis atau penskalaan manual terjadi di titik akhir Anda. Filter berdasarkan label aws.sagemaker.scaling.direction (ScaleOutatauScaleIn) untuk mengidentifikasi arah. |
| 20 | Latensi Penskalaan E2E | e2e_duration |
End-to-end durasi penskalaan dari pemicu hingga penyelesaian (detik). Filter berdasarkan label aws.sagemaker.operation.type (misalnya,UpdateWCEndpoint). |
| 21 | Hitungan ICE | ice_count |
Jumlah kejadian Kesalahan Kapasitas Tidak Cukup per AZ per jenis instans |
| 22 | Jenis Acara Penyeimbangan Kembali | rebalancing_blocked |
Jenis acara penyeimbangan kembali dan kondisinya saat ini |
| 23 | Durasi Penyeimbangan Kembali | rebalancing_duration |
Durasi penyeimbangan kembali dari awal hingga selesai (detik) |
| 24 | Salinan IC Dipindahkan | ic_copy_moved |
Jumlah salinan komponen inferensi yang dipindahkan selama penyeimbangan kembali |
| 25 | Instans Dirilis | instances_released |
Jumlah instans EC2 yang dibebaskan oleh konsolidasi selama penyeimbangan kembali |
| 26 | Durasi Unduhan Model | model_download_time |
Saatnya mengunduh artefak model dari S3 ke instance (detik) |
| 27 | Durasi Beban GPU | gpu_load_time |
Waktu untuk memuat bobot model ke dalam memori GPU (detik) |
| 28 | Durasi Mulai Kontainer | container_start_time |
Waktu dari kontainer mulai melewati pemeriksaan kesehatan (detik) |
Metrik penempatan armada turunan
Selain metrik yang tercantum di atas, dasbor SageMaker AI Insights menghitung metrik yang diturunkan dari data penempatan bidang kontrol. Ini adalah tampilan agregat yang terlihat di dasbor dan bukan nama metrik yang dapat dikueri secara individual di Amazon CloudWatch Query Studio.
Metrik penempatan armada turunan meliputi:
-
Jumlah instans per zona ketersediaan
-
Jumlah salinan IC per zona ketersediaan
-
AZ skew (persentase ketidakseimbangan distribusi di seluruh armada Anda)
-
Salinan IC per instance
Nilai-nilai ini terlihat di tab Keandalan dasbor SageMaker AI Insights.