View a markdown version of this page

Amazon SageMaker AI 推論エンドポイントの詳細なオブザーバビリティ - Amazon SageMaker AI

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

Amazon SageMaker AI 推論エンドポイントの詳細なオブザーバビリティ

詳細なオブザーバビリティは、Amazon SageMaker AI リアルタイム推論エンドポイントの次世代メトリクスエクスペリエンスです。OpenTelemetry (OTel) 上に構築され、GPU、ノード、推論フレームワークレイヤーからきめ細かな運用メトリクスを収集し、エンドポイント名、推論コンポーネント名、インスタンス ID、アベイラビリティーゾーン、インスタンスタイプなどの豊富なラベルを使用して Amazon CloudWatch に公開します。

主な機能

  • OpenTelemetry ネイティブコレクション。メトリクスは、DCGM (GPU メトリクス)、ノードエクスポーター (CPU、メモリ、ディスク)、推論フレームワークコンテナ (vLLM、SGLang) から Prometheus エンドポイントをスクレイプする OTel Collector を使用して収集されます。

  • 豊富なディメンションラベル。すべてのメトリクスは、正確なフィルタリングと集計@resource.host.typeのために、aws.sagemaker.endpoint.nameaws.sagemaker.inference_component.name@resource.cloud.availability_zone、、 @resource.host.idなどのラベルで発行されます。

  • GPU ごとの属性。GPU メトリクス (DCGM) per-inference-component属性が含まれており、どのモデルがマルチテナントインスタンスで GPU リソースを消費しているかを特定できます。

  • 推論フレームワークメトリクス。1 秒あたりのトークン数、最初のトークンまでの時間 (TTFT)、トークン間レイテンシー、KV キャッシュ使用率、キュー深度、バッチサイズなどのネイティブ vLLM および SGLang メトリクスは、カスタム計測なしで使用できます。

  • PromQL クエリのサポート。Amazon CloudWatch、CloudWatch Query Studio、または Amazon Managed Grafana で PromQL CloudWatch 構文を使用してメトリクスをクエリします。

  • 設定可能なスクレイプ頻度。を使用してメトリクスを収集する頻度を制御します MetricPublishFrequencyInSeconds (有効な値: 10、30、60、120、180、240、300 秒)。デフォルトは 60 秒です。ライフサイクル、自動スケーリング、ICE 診断などのコントロールプレーンメトリクスはイベント駆動型であり、この設定の影響を受けません。

注記

詳細なオブザーバビリティは、OTLP を介して OpenTelemetry (OTel) メトリクスを Amazon CloudWatch に発行します。これらは Prometheus メトリクスではありません。メトリクスは OTel メトリクスデータとして Amazon CloudWatch にネイティブに保存され、PromQL 構文を使用してクエリできます。PromQL はクエリ言語としてのみサポートされています。Prometheus サーバーまたは Prometheus 互換バックエンドは関係ありません。

含まれるもの

詳細なオブザーバビリティメトリクスカテゴリ
Category メトリクス スコープ 頻度
推論フレームワーク (vLLM/SGLang) TTFT、ITL、KV キャッシュ、キューの深さ、バッチサイズ、TPS、同時リクエスト 推論コンポーネントエンドポイントの IC 単位、SME のインスタンス単位/エンドポイント単位 設定可能
GPU ヘルス (DCGM) GPU 使用率、メモリコピー使用率、GPU 温度 インスタンスごと、GPU ごと 設定可能
ノードのヘルス CPU、メモリ、ディスク、ファイルシステム インスタンスごと 設定可能
推論コンポーネントの配置と高可用性 IC コピー数、AZ あたりのコピー数、AZ スキュー、インスタンスあたりの IC、AZ あたりのインスタンス数 エンドポイントあたり 定期的
Lifecycle モデルのダウンロード時間、GPU ロード時間、コンテナ開始、コールドスタート IC ごと、エンドポイントごと イベント駆動型
自動スケーリング イベントのスケーリング、E2E レイテンシー、再調整 エンドポイントあたり イベント駆動型
ICE 診断 ICE 数、失敗したタイプ、失敗した AZ エンドポイントあたり イベント駆動型

完全なリストについては、「OpenTelemetry メトリクスリファレンス」を参照してください。

アーキテクチャとデータフロー

詳細なオブザーバビリティのためのメトリクス収集パイプラインを示すアーキテクチャ図。

各エンドポイントインスタンスは、複数のソースからのメトリクスを公開します。OTel Collector はこれらのソースをスクレイプし、コンテキストラベルでデータを充実させ、Amazon CloudWatch アカウントにエクスポートします。

  1. モデルコンテナDCGM エクスポーターノードエクスポーターは、インスタンスで Prometheus 互換メトリクス (それぞれ推論フレームワークメトリクス、GPU メトリクス、CPU/memory/diskメトリクス) を公開します。

  2. OTel Collector はこれらのエンドポイントをスクレイプし、エンドポイント名、推論コンポーネント名、インスタンス ID、アベイラビリティーゾーンなどのラベルを使用して各メトリクスを強化します。

  3. 強化されたメトリクスは、OTLP を介してアカウントの Amazon CloudWatch にエクスポートされます。

  4. メトリクスは、 の Amazon CloudWatch の PromQL を介してクエリできますhttps://monitoring.region.amazonaws.com

料金

詳細なオブザーバビリティメトリクスは追加コストなしで含まれます。OTel エンリッチメントに関連する Amazon CloudWatch データ取り込みコストについては、Amazon CloudWatch の料金」を参照してください。