本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
OpenTelemetry 指標參考
本節提供 Amazon SageMaker AI 詳細可觀測性發出的 OpenTelemetry 指標完整清單 (非詳盡),並可在 SageMaker AI Insights 中取得。
OpenTelemetry 指標標籤
OpenTelemetry 指標包含標籤 (屬性),可識別與每個資料點相關聯的資源。使用這些標籤來篩選和分組查詢中的指標。
| OpenTelemetry 標籤 | 說明 |
|---|---|
aws.sagemaker.endpoint.name |
Endpoint name (端點名稱) |
aws.sagemaker.variant.name |
生產變體名稱 |
aws.sagemaker.inference_component.name |
推論元件名稱 |
@resource.host.id |
EC2 執行個體 ID |
aws.sagemaker.container.id |
容器 ID |
@resource.cloud.availability_zone |
Availability zone (可用區域) |
@resource.host.type |
執行個體類型 |
帳戶層級彙總指標
這些指標位於帳戶層級。
| # | 指標 | 說明 |
|---|---|---|
| 1 | TotalEndpoints |
帳戶中作用中端點的總數 |
| 2 | TotalICs |
部署在所有端點的推論元件總數 |
| 3 | TotalInvocations |
所有端點的推論請求總數 |
GPU (DCGM) 指標
這些指標是從資料中心 GPU Manager (DCGM) 匯出工具收集,無論推論架構為何,都可以在所有 GPU 端點上使用。
可以在推論元件、執行個體或端點層級彙總。
| # | 指標 | 來源指標 (s) | 說明 |
|---|---|---|---|
| 4 | GPU 使用率 (%) | DCGM_FI_DEV_GPU_UTIL |
GPU 主動執行工作負載的時間百分比 |
| 5 | GPU 記憶體使用率 (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
記憶體控制器主動將資料移入或移出 GPU 記憶體的時間百分比 |
節點 (執行個體) 指標
這些指標會從節點匯出工具收集,並提供 CPU、記憶體和磁碟使用率的執行個體層級可見性。
可以在執行個體或端點層級彙總。
| # | 指標 | 來源指標 (s) | 說明 |
|---|---|---|---|
| 6 | CPU 使用率 (%) | node_cpu_seconds_total |
累計計數器,測量自開機以來,每個執行模式 (閒置、使用者、系統、iowait) 所花費的總 CPU 秒數。從閒置模式速率衍生使用率百分比。 |
| 7 | 記憶體使用率 (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
使用中的實體記憶體百分比。衍生自總記憶體減去可用記憶體。 |
| 8 | 磁碟使用率 (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
使用中的檔案系統空間百分比。衍生自總大小減去可用空間。 |
推論架構指標 (vLLM/SGLang)
推論架構指標由模型容器內執行的服務引擎原生發出。啟用詳細可觀測性時,SageMaker AI 會自動從支援的架構 (vLLM 和 SGLang) 收集這些指標。這些指標可在推論元件層級提供字符輸送量、延遲、KV 快取壓力和請求佇列的可見性。
這些指標可歸因於端點、推論元件或執行個體層級。
| # | 指標 | 來源指標 (s) | 說明 |
|---|---|---|---|
| 9 | 每秒輸入字符數 | vllm:prompt_tokens_total |
每秒處理的提示字符總數 |
| 10 | 每秒輸出權杖數 | vllm:generation_tokens_total |
每秒產生的字符總數 |
| 11 | TPS 總計 | 衍生自 #9 + #10 | 每秒合併輸入和輸出字符 |
| 12 | TPS 使用率 % | 衍生自 #11 | 目前字符輸送量佔觀察尖峰的百分比 |
| 13 | TTFT | vllm:time_to_first_token_seconds |
從請求到達到第一個產生的字符的時間 (長條圖) |
| 14 | 權杖間延遲 | vllm:inter_token_latency_seconds |
連續產生字符之間的平均時間 (長條圖) |
| 15 | KV 快取使用率 | vllm:gpu_cache_usage_perc |
目前使用中的 GPU KV-cache 記憶體百分比 |
| 16 | 佇列深度 | vllm:num_requests_waiting |
在佇列中等待處理的請求數量 |
| 17 | 批次大小 | vllm:num_requests_running |
目前正在執行的請求數量 (進行中) |
| 18 | 模型延遲 | vllm:e2e_request_latency_seconds |
從到達到最終字符End-to-end請求延遲 (長條圖) |
注意
字首為 的指標vllm:具有 SGLang 端點的同等sglang:對應項目。
操作驅動指標
這些指標是由事件驅動,並由您的建立、更新或擴展操作發出至端點或推論元件。它們不受 影響MetricPublishFrequencyInSeconds。
這些指標可歸因於端點和推論元件層級。
| # | 指標 | 來源指標 (s) | 說明 |
|---|---|---|---|
| 19 | 擴展事件 | e2e_duration |
表示您的端點上發生自動擴展或手動擴展動作。依標籤 aws.sagemaker.scaling.direction(ScaleOut 或 ScaleIn) 篩選以識別方向。 |
| 20 | E2E 擴展延遲 | e2e_duration |
從觸發到完成End-to-end擴展持續時間 (秒)。依標籤篩選 aws.sagemaker.operation.type(例如,UpdateWCEndpoint)。 |
| 21 | ICE 計數 | ice_count |
每個執行個體類型每個 AZ 的容量不足錯誤事件數量 |
| 22 | 重新平衡事件類型 | rebalancing_blocked |
重新平衡事件的類型及其目前狀態 |
| 23 | 重新平衡持續時間 | rebalancing_duration |
從開始到完成的重新平衡持續時間 (秒) |
| 24 | 移動的 IC 副本 | ic_copy_moved |
在重新平衡期間移動的推論元件複本數量 |
| 25 | 發行的執行個體 | instances_released |
重新平衡期間由整合釋放的 EC2 執行個體數量 |
| 26 | 模型下載持續時間 | model_download_time |
從 S3 下載模型成品到執行個體的時間 (秒) |
| 27 | GPU 載入持續時間 | gpu_load_time |
將模型權重載入 GPU 記憶體的時間 (秒) |
| 28 | 容器啟動持續時間 | container_start_time |
從容器開始到通過運作狀態檢查的時間 (秒) |
衍生機群置放指標
除了上述指標之外,SageMaker AI Insights 儀表板還會從控制平面放置資料運算衍生的指標。這些是儀表板上可見的彙總檢視,不是 Amazon CloudWatch Query Studio 中個別可查詢的指標名稱。
衍生機群置放指標包括:
-
每個可用區域的執行個體計數
-
每個可用區域的 IC 複製計數
-
AZ 扭曲 (整個機群的分佈不平衡百分比)
-
每個執行個體的 IC 副本
這些值會顯示在 SageMaker AI Insights 儀表板的可靠性索引標籤上。