View a markdown version of this page

OpenTelemetry 指標參考 - Amazon SageMaker AI

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

OpenTelemetry 指標參考

本節提供 Amazon SageMaker AI 詳細可觀測性發出的 OpenTelemetry 指標完整清單 (非詳盡),並可在 SageMaker AI Insights 中取得。

OpenTelemetry 指標標籤

OpenTelemetry 指標包含標籤 (屬性),可識別與每個資料點相關聯的資源。使用這些標籤來篩選和分組查詢中的指標。

OpenTelemetry 標籤 說明
aws.sagemaker.endpoint.name Endpoint name (端點名稱)
aws.sagemaker.variant.name 生產變體名稱
aws.sagemaker.inference_component.name 推論元件名稱
@resource.host.id EC2 執行個體 ID
aws.sagemaker.container.id 容器 ID
@resource.cloud.availability_zone Availability zone (可用區域)
@resource.host.type 執行個體類型

帳戶層級彙總指標

這些指標位於帳戶層級。

# 指標 說明
1 TotalEndpoints 帳戶中作用中端點的總數
2 TotalICs 部署在所有端點的推論元件總數
3 TotalInvocations 所有端點的推論請求總數

GPU (DCGM) 指標

這些指標是從資料中心 GPU Manager (DCGM) 匯出工具收集,無論推論架構為何,都可以在所有 GPU 端點上使用。

可以在推論元件、執行個體或端點層級彙總。

# 指標 來源指標 (s) 說明
4 GPU 使用率 (%) DCGM_FI_DEV_GPU_UTIL GPU 主動執行工作負載的時間百分比
5 GPU 記憶體使用率 (%) DCGM_FI_DEV_MEM_COPY_UTIL 記憶體控制器主動將資料移入或移出 GPU 記憶體的時間百分比

節點 (執行個體) 指標

這些指標會從節點匯出工具收集,並提供 CPU、記憶體和磁碟使用率的執行個體層級可見性。

可以在執行個體或端點層級彙總。

# 指標 來源指標 (s) 說明
6 CPU 使用率 (%) node_cpu_seconds_total 累計計數器,測量自開機以來,每個執行模式 (閒置、使用者、系統、iowait) 所花費的總 CPU 秒數。從閒置模式速率衍生使用率百分比。
7 記憶體使用率 (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes 使用中的實體記憶體百分比。衍生自總記憶體減去可用記憶體。
8 磁碟使用率 (%) node_filesystem_avail_bytes, node_filesystem_size_bytes 使用中的檔案系統空間百分比。衍生自總大小減去可用空間。

推論架構指標 (vLLM/SGLang)

推論架構指標由模型容器內執行的服務引擎原生發出。啟用詳細可觀測性時,SageMaker AI 會自動從支援的架構 (vLLM 和 SGLang) 收集這些指標。這些指標可在推論元件層級提供字符輸送量、延遲、KV 快取壓力和請求佇列的可見性。

這些指標可歸因於端點、推論元件或執行個體層級。

# 指標 來源指標 (s) 說明
9 每秒輸入字符數 vllm:prompt_tokens_total 每秒處理的提示字符總數
10 每秒輸出權杖數 vllm:generation_tokens_total 每秒產生的字符總數
11 TPS 總計 衍生自 #9 + #10 每秒合併輸入和輸出字符
12 TPS 使用率 % 衍生自 #11 目前字符輸送量佔觀察尖峰的百分比
13 TTFT vllm:time_to_first_token_seconds 從請求到達到第一個產生的字符的時間 (長條圖)
14 權杖間延遲 vllm:inter_token_latency_seconds 連續產生字符之間的平均時間 (長條圖)
15 KV 快取使用率 vllm:gpu_cache_usage_perc 目前使用中的 GPU KV-cache 記憶體百分比
16 佇列深度 vllm:num_requests_waiting 在佇列中等待處理的請求數量
17 批次大小 vllm:num_requests_running 目前正在執行的請求數量 (進行中)
18 模型延遲 vllm:e2e_request_latency_seconds 從到達到最終字符End-to-end請求延遲 (長條圖)
注意

字首為 的指標vllm:具有 SGLang 端點的同等sglang:對應項目。

操作驅動指標

這些指標是由事件驅動,並由您的建立、更新或擴展操作發出至端點或推論元件。它們不受 影響MetricPublishFrequencyInSeconds。

這些指標可歸因於端點和推論元件層級。

# 指標 來源指標 (s) 說明
19 擴展事件 e2e_duration 表示您的端點上發生自動擴展或手動擴展動作。依標籤 aws.sagemaker.scaling.direction(ScaleOut 或 ScaleIn) 篩選以識別方向。
20 E2E 擴展延遲 e2e_duration 從觸發到完成End-to-end擴展持續時間 (秒)。依標籤篩選 aws.sagemaker.operation.type(例如,UpdateWCEndpoint)。
21 ICE 計數 ice_count 每個執行個體類型每個 AZ 的容量不足錯誤事件數量
22 重新平衡事件類型 rebalancing_blocked 重新平衡事件的類型及其目前狀態
23 重新平衡持續時間 rebalancing_duration 從開始到完成的重新平衡持續時間 (秒)
24 移動的 IC 副本 ic_copy_moved 在重新平衡期間移動的推論元件複本數量
25 發行的執行個體 instances_released 重新平衡期間由整合釋放的 EC2 執行個體數量
26 模型下載持續時間 model_download_time 從 S3 下載模型成品到執行個體的時間 (秒)
27 GPU 載入持續時間 gpu_load_time 將模型權重載入 GPU 記憶體的時間 (秒)
28 容器啟動持續時間 container_start_time 從容器開始到通過運作狀態檢查的時間 (秒)

衍生機群置放指標

除了上述指標之外,SageMaker AI Insights 儀表板還會從控制平面放置資料運算衍生的指標。這些是儀表板上可見的彙總檢視,不是 Amazon CloudWatch Query Studio 中個別可查詢的指標名稱。

衍生機群置放指標包括:

  • 每個可用區域的執行個體計數

  • 每個可用區域的 IC 複製計數

  • AZ 扭曲 (整個機群的分佈不平衡百分比)

  • 每個執行個體的 IC 副本

這些值會顯示在 SageMaker AI Insights 儀表板的可靠性索引標籤上。