翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
Amazon SageMaker HyperPod Inference リリースノート
このトピックでは、Amazon SageMaker HyperPod Inference の更新、修正、新機能を追跡するリリースノートについて説明します。SageMaker HyperPod Inference を使用すると、エンタープライズグレードの信頼性で HyperPod クラスターに機械学習モデルをデプロイおよびスケーリングできます。Amazon SageMaker HyperPod プラットフォームの一般的なリリース、更新、改善については、「」を参照してくださいAmazon SageMaker HyperPod リリースノート。
SageMaker HyperPod 推論機能とデプロイオプションの詳細については、「」を参照してくださいAmazon SageMaker HyperPod にモデルをデプロイする。
SageMaker HyperPod Inference リリースノート: HyperPod Inference Amazon EKS v2.0.0-eksbuild.2 および Inference Operator v3.6
リリース日: 2026 年 9 月 10 日
[概要]
HyperPod Inference Amazon EKS アドオンのv2.0.0-eksbuild.2リリースでは、HyperPod Inference Gateway が導入されました。HyperPod Inference Gateway は、Kubernetes ネイティブの LLM 対応のルーティングレイヤーであり、リクエストボディコンテンツと GPU 対応のエンドポイント選択を使用して、モデル提供ポッド間で推論トラフィックを分散します。Inference Operator と Inference Gateway の両方がこのアドオンリリースの一部として一緒に出荷されます。
これはアドオンのメジャーバージョン更新であり、 から v1.6.0-eksbuild.1に更新されていますv2.0.0-eksbuild.2。バージョンの更新には Inference Gateway の追加が反映され、リリースは既存のアドオン機能と下位互換性が維持されます。どちらのコンポーネントも不要な場合は、 inferenceGateway.enabledまたは inferenceOperator.enabledを に設定することで、アドオン設定で無効にできますfalse。
推論ゲートウェイ
-
推論ゲートウェイ – リクエスト
modelフィールドを読み取る本文ベースのルーター、ヘッダーベースのルーティング用の HTTPRoute を使用するゲートウェイ、GPU 対応の Endpoint Picker の 3 つのルーティングレイヤーを使用して、単一のゲートウェイエンドポイントを介して複数のモデルの推論トラフィックをルーティングします。モデルごとのスケジューラ、スコアリングの重み、LoRA アダプターのサポート、オプションの TLS 終了など、新しいInferenceGatewayConfigCRD でゲートウェイを設定します。「Amazon SageMaker HyperPod 推論用の推論ゲートウェイ」を参照してください。
推論演算子
-
InferenceEndpointConfigと でのゲートウェイ統合JumpStartModel— 両方の CRD にオプションinferenceGatewayフィールドを追加しました。 CRDs モデルを共有ゲートウェイにオプトインtrueするには、inferenceGateway.enabledに設定します。次に、オペレーターはそのモデルのスケジューラエントリを に追加しInferenceGatewayConfig、まだ存在しない場合はゲートウェイを作成します。inferenceGateway.nameを使用してゲートウェイを選択します。同じ名前空間で同じ名前を指定するモデルは 1 つのゲートウェイを共有し、まだ使用されていない名前は新しいゲートウェイを作成します。フィールドが空の場合、オペレータは一意の名前を生成して、モデルが独自のゲートウェイを取得します。オペレーターは、 でのゲートウェイの準備状況をミラーリングしますstatus.inferenceGateway。詳細については、「HyperPod Inference Operator との統合」を参照してください。 -
でのカスタムポッド注釈
InferenceEndpointConfig— にオプションpodTemplateAnnotationsフィールドを追加しましたspec.kubernetes。演算子は、これらの注釈を基盤となるポッドに伝達し、メトリクスの自動検出などのポッドスクレイピング統合がそれらの注釈を読み取られるようにします。
v2.0.0-eksbuild.2 または v3.6 へのアップグレード
設定スキーマの変更:
このリリースでアドオン設定スキーマが変更されました。 inferenceGatewayが新しく追加され、HyperPod Inference Gateway が設定されます。このスキーマでは も追加されるためinferenceOperator、推論演算子を個別にオンまたはオフにすることができます。両方のコンポーネントはデフォルトで有効になっており、 inferenceGateway.enabledと は にinferenceOperator.enabled設定されていますtrue。いずれかのコンポーネントを無効にするには、 falseでそのenabledフィールドを に設定します--configuration-values。
EKS アドオンのアップグレード:
EKS アドオンとして推論演算子をインストールした場合は、次のコマンドv2.0.0-eksbuild.2を使用して にアップグレードします。
CLUSTER=EKS_CLUSTER_NAME REGION=REGION ACCOUNT=AWS_ACCOUNT_ID aws eks update-addon \ --cluster-name $CLUSTER --region $REGION \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v2.0.0-eksbuild.2 \ --resolve-conflicts OVERWRITE \ --configuration-values '{ "executionRoleArn": "arn:aws:iam::<ACCOUNT>:role/<EXEC_ROLE>", "tlsCertificateS3Bucket": "<TLS_BUCKET>", "inferenceOperator": { "enabled": true }, "inferenceGateway": { "enabled": true, "serviceAccount": { "roleArn": "arn:aws:iam::<ACCOUNT>:role/<CERT_ISSUER_ROLE>" } }, "keda": { "enabled": true, "auth": { "aws": { "irsa": { "enabled": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<KEDA_IRSA_ROLE>" } } } }, "alb": { "enabled": true, "serviceAccount": { "create": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<ALB_IRSA_ROLE>" } }, "jumpstartGatedModelDownloadRoleArn": "arn:aws:iam::<ACCOUNT>:role/<JUMPSTART_ROLE>" }'
Helm のアップグレード:
Inference Gateway は、Amazon EKS アドオンを介してのみ使用できます。Helm で推論オペレーターを管理し、オペレーター専用機能を引き続き使用する場合は、次のコマンドを使用して Helm リリースをアップグレードします。Inference Operator と Inference Gateway の両方の機能を最大限に活用するには、 アドオンに移行することをお勧めします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.6 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Helm から Amazon EKS アドオンへの移行については、「」を参照してくださいHelm から EKS へのアドオン移行。
SageMaker HyperPod Inference リリースノート: HyperPod Inference Amazon EKS v1.6.0-eksbuild.1 および Inference Operator v3.5
リリース日: 2026 年 9 月 3 日
[概要]
Amazon SageMaker HyperPod Inference Operator v3.5 では、モデルの重みが事前にキャッシュされている場所を直接制御できます。演算子がデプロイから派生するインスタンスタイプのみに依存するのではなく、独自のノードアフィニティルールを重みキャッシュにアタッチできるようになりました。このリリースでは、インバウンドリクエストボリュームに 2 つの Prometheus メトリクスが追加され、いくつかのセキュリティ修正が含まれています。
Amazon SageMaker HyperPod Inference Operator v3.5 は、SageMaker HyperPod がサポートされているすべての AWS リージョンで使用できます。
新機能
-
モデル重みキャッシュのノードアフィニティ –
InferenceEndpointConfigまたはmodelCacheConfig.weightsCacheの にある新しいnodeAffinityフィールドを使用して、モデルの重みを事前キャッシュするノードを制限しますJumpStartModel。フィールドは標準の Kubernetes ノードアフィニティ構造を受け入れるため、requiredDuringSchedulingIgnoredDuringExecutionおよびpreferredDuringSchedulingIgnoredDuringExecution用語を取得します。複数のnodeSelectorTermsは OR セマンティクスを提供し、1 つのデプロイでノードプール、アベイラビリティーゾーン、またはカスタムラベルセットをターゲットにできます。演算子は、
spec.instanceTypeまたは から派生するインスタンスタイプに加えてルールを適用するためspec.instanceTypes、重みは両方を満たすノードにのみキャッシュされます。これを使用して、重みキャッシュを単一のアベイラビリティーゾーンまたは特定の HyperPod インスタンスグループにピン留めします。 -
インバウンドリクエストの追跡 – 2 つの新しい Prometheus メトリクスにより、インバウンド推論リクエストボリュームを可視化できるため、総需要を測定し、負荷を追跡し、それに応じて自動スケーリングと容量を計画できます。
-
model_requests_received_total– アドミッションコントロールの決定の前に、プロキシエントリポイントのすべてのリクエストをカウントします。これには、後で拒否されるリクエストが含まれます。 -
model_requests_shed_total– スロットリングによるアドミッションコントロールによって拒否されたリクエストをカウントします。
-
v3.5 または v1.6.0-eksbuild.1 へのアップグレード
Helm のアップグレード:
Helm を使用して推論演算子を既にインストールしている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.5 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
EKS アドオンのアップグレード:
EKS アドオンとして推論演算子をインストールした場合は、最新バージョンにアップグレードします。
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.6.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Inference リリースノート: HyperPod Inference Amazon EKS v1.5.0-eksbuild.1 および Inference Operator v3.4
リリース日: 2026 年 8 月 21 日
[概要]
Amazon SageMaker HyperPod Inference Operator v3.4 は、マネージドサイドカーコンテナのリソースリクエストと制限を CRD を介して設定できるようにします。固定デフォルトに依存するのではなく、ワークロードに合わせてリバースプロキシ、メトリクスコレクター、データキャプチャアップローダーコンテナのサイズを変更できるようになりました。
Amazon SageMaker HyperPod Inference Operator v3.4 は、SageMaker HyperPod がサポートされているすべての AWS リージョンで使用できます。
新機能
-
設定可能なコンテナリソース – オペレーター管理のサイドカーコンテナのリソースリクエストと制限を設定します。
InferenceEndpointConfigまたは で新しいmetricsSidecarResources、metricsCollectorResources、およびs3UploaderResourcesフィールドを使用しますJumpStartModel。これらのフィールドを使用すると、同時実行性の高いデプロイのリバースプロキシメモリを増やしたり、メトリクスコレクターを調整したり、データキャプチャアップローダーのサイズを変更したりできます。フィールドが設定されると、演算子は組み込みのデフォルトの代わりに値を適用し、調整全体で値を保持します。各フィールドはコンテナのリソースブロックを完全に置き換えるため、完全なリクエストと制限を指定します。
v3.4 または v1.5.0-eksbuild.1 へのアップグレード
Helm のアップグレード:
Helm を使用して推論演算子を既にインストールしている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.4 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
EKS アドオンのアップグレード:
EKS アドオンとして推論演算子をインストールした場合は、最新バージョンにアップグレードします。
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.5.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Inference リリースノート: HyperPod Inference Amazon EKS v1.4.0-eksbuild.1 および Inference Operator v3.3
リリース日: 2026 年 8 月 4 日
[概要]
Amazon SageMaker HyperPod Inference Operator v3.3 では、ホストローカルモデルキャッシュが導入されています。これにより、推論デプロイをスケールアウトする際のコールドスタートレイテンシーが短縮されます。このリリースでは、Application Load Balancer のアイドルタイムアウトをデプロイごとに設定することもできます。
Amazon SageMaker HyperPod Inference Operator v3.3 は、SageMaker HyperPod がサポートされているすべての AWS リージョンで使用できます。
新機能
-
モデルの重みとイメージキャッシュ — ノードローカル NVMe ストレージでモデルの重みをキャッシュし、推論サーバーコンテナイメージをターゲットノードにプリプルします。スケールアウト中に追加されたポッドは、Amazon S3 または Amazon FSx から重みをダウンロードしません。コールドイメージのプルを待つことはありません。CRD
modelCacheConfigで を使用して、いずれかのメカニズムを個別に、または両方で有効にします。この機能には、ローカル NVMe ストレージを備えたインスタンスタイプが必要です。「モデルの重みキャッシュとイメージキャッシュ」を参照してください。 -
設定可能な ALB アイドルタイムアウト –
InferenceEndpointConfigまたはloadBalancer.idleTimeoutSecondsで を使用して、Application Load Balancer がアイドル接続を開いたままにする時間を制御しますJumpStartModel。有効な値は 1~4000 秒で、デフォルトは 60 秒です。リクエストがレスポンスを返すのにデフォルトよりも時間がかかるデプロイの場合は、この値を増やします。
バグ修正
-
ルーティングサービスの欠落 – 中断された初期調整が Kubernetes ルーティングサービスなしでデプロイを離れる可能性がある問題を修正しました。このサービスは、デプロイの Ingress and Load Balancer をバックアップします。エンドポイントは HTTP 503 レスポンスを返し、すべてのヘルスシグナルは正常であると報告しました。オペレーターは、ルーティングサービスが欠落している場合に再作成します。
-
インテリジェントルーティングエンドポイントの登録 – インテリジェントルーティングデプロイで、イングレスパス検索にプレフィックスのない名前を使用する問題を修正しました。すべての照合でルックアップが失敗し、SageMaker AI エンドポイントの登録が完了できませんでした。
-
KV キャッシュ設定 – オペレータが
falseで を優先enableL1Cacheしないか、enableL2Cacheに設定しない問題を修正しましたkvCacheSpec。
v3.3 または v1.4.0-eksbuild.1 へのアップグレード
Helm のアップグレード:
Helm を使用して推論演算子を既にインストールしている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.3 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
EKS アドオンのアップグレード:
EKS アドオンとして推論演算子をインストールした場合は、最新バージョンにアップグレードします。
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.4.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Inference リリースノート: HyperPod Inference Amazon EKS v1.3.0-eksbuild.1 および Inference Operator v3.2
リリース日: 2026 年 6 月 12 日
[概要]
Inference Operator v3.2 を使用すると、お客様は、同時ロード時にトークンごとの予測可能なレイテンシーで、ロングコンテキスト LLMs (Llama 3.3 70B など) をデプロイできます。このリリースでは、Disaggregated Prefill and Decode (DPD) が導入されました。DPD は、コンピューティングバウンドプリフィルフェーズとmemory-bandwidth-boundドデコードフェーズを個別の GPU プールに分離し、GPU-Direct RDMA を使用して EFA 経由でそれらの間で KV キャッシュを転送します。DPD はトークンごとのテールレイテンシーを減らし、スループットを向上させ、事前入力容量とデコード容量を個別にスケールできます。DPD に加えて、このリリースには他のバグ修正が含まれています。
主な機能
集約解除された事前入力とデコード (DPD)
-
InferenceEndpointConfigCRD に、分散推論を有効にする新しいpdSpecフィールドを追加しました。を設定すると、オペレータpdSpecは別々のプリフィラーポッドとデコーダーポッドをプロビジョニングし、DPD ルーターを介してそれらをワイヤ接続し、NIXL 経由で LMCache を使用してポッド間で KV キャッシュを転送し、GPU-Direct RDMA で EFA を転送します。設定可能なフィールドの例は次のとおりです (より多くの設定でユーザーガイドを確認できます)。-
routingThreshold– リクエストが集約解除されたパスを使用するトークン長のしきい値。しきい値を下回ると、リクエストはプリフィラーをバイパスし、デコーダーに直接移動します。 -
prefillSpec.argsおよびdecodingSpec.args– 起動worker.args時にマージされたロールごとの vLLM フラグ。 -
prefillSpec.replicasおよびdecodingSpec.replicas– ワークロードの入出力長分布に合わせて、事前入力容量とデコード容量を個別にスケールします。
-
-
前提条件
-
DPD エンドポイントをデプロイするには、クラスターノードが RDMA の読み取りと書き込みで EFA をサポートし、高帯域幅のnode-to-node通信のために同じアベイラビリティーゾーン内に配置されている必要があります。
-
推奨されるインスタンスファミリー:
ml.p5.48xlarge、ml.p5e.48xlarge、ml.p5en.48xlarge、ml.p6-b200.48xlarge、ml.p6-b300.48xlarge。
-
バグ修正
-
x86 ノードでのオペレータのスケジュール – オペレータ
nodeAffinityのデプロイでは、 を使用して amd64 Linux ノードにのみスケジュールできるようになりました。 -
その他のマイナー修正とセキュリティ修正が含まれています。
v3.2 または v1.3.0-eksbuild.1 へのアップグレード
Helm のアップグレード:
Helm 経由で Inference Operator が既にインストールされている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
EKS アドオンのアップグレード:
EKS アドオンとして推論演算子をインストールした場合は、最新バージョンにアップグレードします。
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.3.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Inference リリースノート: HyperPod Inference Amazon EKS v1.2.0-eksbuild.1 および Inference Operator v3.1.2
リリース日: 2026 年 5 月 6 日
[概要]
Inference Operator v3.1.2 では、エンドポイントトラフィックのログ記録用の推論データキャプチャ、直接モデルデプロイ用の HuggingFace Hub 統合、カスタムドメイン用の Route 53 DNS 管理、コールドスタートレイテンシーを低減するためのローカル NVMe モデルデプロイ、および IRSA サポート付きのカスタムサービスアカウントが導入されています。
新機能
-
推論データキャプチャ – SageMaker AI エンドポイント、ロードバランサー (ALB アクセスログ)、モデルポッドの 3 つのキャプチャポイントで入出力を記録します。CRD
dataCaptureで を介して任意の組み合わせを有効にします。「HyperPod での推論のためのデータキャプチャ」を参照してください。 -
HuggingFace モデルソース – S3 または FSx に事前ステージングすることなく、HuggingFace Hub から直接モデルをデプロイします。を介したゲートモデル
tokenSecretRef、 を介したリビジョンピン留めcommitSHA、トークン分離をサポートします。vLLM、TGI、SGLang ランタイムと互換性があります。「kubectl を使用して Amazon S3、Amazon FSx、または Hugging Face Hub からモデルをデプロイする」を参照してください。 -
Route 53 DNS 管理 – を介してカスタムドメインの DNS レコードを自動的に作成および管理します
dnsConfig。「HyperPod Inference のカスタム証明書と Route 53 DNS 管理」を参照してください。 -
ローカル NVMe モデルのデプロイ — を介してノードローカル NVMe ストレージからモデルの重みをロード
modelSourceType: kubernetesVolumeし、コールドスタートレイテンシーを減らします。S3 へのフォールバックをサポートします。「kubectl を使用してローカル NVMe ストレージからモデルをデプロイする」を参照してください。 -
カスタムサービスアカウント – IRSA をサポートするカスタム ServiceAccounts を 経由で推論ポッドに割り当てます
spec.kubernetes.serviceAccountName。
バグ修正
-
タグの伝播 — のユーザー定義タグが
SageMakerEndpointRegistrationCRD およびダウンストリームの SageMaker AI リソースに正しく伝達されるInferenceEndpointConfigようになりました。以前は、エンドポイント登録の作成時または更新時にタグが渡されませんでした。 -
Auto Scaling Replica Preservation –
InferenceEndpointConfigまたはJumpStartModelCR を更新すると、レプリカ数が仕様値にリセットされ、現在の HPA/KEDA マネージドレプリカ数が上書きされる問題を修正しました。演算子は、CR 更新中にアクティブなレプリカ数を保持するようになりました。 -
自動スケーリング CRD 検証 – 末尾のパスセグメントが誤って必要になり、KEDA
/api/v1/queryが AMP ワークスペース URL に追加されたときに 404 エラーが発生するprometheusTrigger.serverAddress検証正規表現を修正しました。 -
証明書のローテーション — オペレータポッドの再起動後に ALB に伝達されないカスタム証明書のローテーションを修正しました。
v3.1.2 または v1.2.0-eksbuild.1 へのアップグレード
Helm のアップグレード:
Helm 経由で Inference Operator が既にインストールされている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
EKS アドオンのアップグレード:
EKS アドオンとして推論演算子をインストールした場合は、最新バージョンにアップグレードします。
まず、 hyperpodClusterArnが既にアドオン設定にあるかどうかを確認します。
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text | jq .
hyperpodClusterArn が出力に存在する場合は、次のコマンドを実行してアップグレードします。
aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
hyperpodClusterArn が存在しない場合は、現在の設定を取得し、追加してアップグレードします。
HP_ARN=HYPERPOD_CLUSTER_ARN CURRENT_CONFIG=$(aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text) # Add hyperpodClusterArn to the configuration NEW_CONFIG=$(echo "$CURRENT_CONFIG" | jq --arg arn "$HP_ARN" \ '. + {hyperpodClusterArn: $arn}') aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --configuration-values "$NEW_CONFIG" \ --resolve-conflicts OVERWRITE \ --region $REGION
モデルをデプロイする前に、アドオンがアクティブになるまで待ちます。
SageMaker HyperPod Inference リリースノート: Inference Operator v3.1
リリース日: 2026 年 4 月 3 日
[概要]
Inference Operator v3.1 では、カスタム Kubernetes ポッド設定、カスタム証明書のサポート、ポッドごとのリクエスト制限が導入されています。
主な機能
-
カスタム Kubernetes ポッド設定 – 推論ポッド設定をカスタマイズできる新しい
kubernetesフィールドをInferenceEndpointConfigCRD に追加しました。-
カスタム init コンテナ – 推論サーバーが起動する前にユーザー定義の init コンテナを実行します (キャッシュウォームアップ、GDS セットアップなど)。Init コンテナは、オペレータのプリフェッチコンテナの後に挿入されます。
-
カスタムボリューム – ポッド仕様に追加のボリューム (
emptyDir、hostPath、configMapなど) を追加します。これは、 経由で init コンテナで参照できますvolumeMounts。 -
カスタムスケジューラ名 – ポッド配置用のカスタム Kubernetes スケジューラを指定します。
-
-
カスタム証明書 – を介して設定された、オペレータが生成した自己署名証明書の代わりに、推論エンドポイントに独自の ACM 証明書を使用します
customCertificateConfig。パブリックに信頼された ACM 証明書、 AWS プライベート CA 証明書、および外部 CAs からインポートされた証明書をサポートします。オペレーターは証明書の状態をモニタリングし、自動更新検出をサポートします。 -
リクエストの制限 – 以下の設定可能なフィールドを使用して
Worker、 の新しいRequestLimits設定を介してポッドあたりのリクエスト処理を制御します。-
maxConcurrentRequests– ポッドあたりの同時処理中のリクエストの最大数。 -
maxQueueSize– 拒否する前に同時実行数の制限に達したときにキューに入れるリクエスト。 -
overflowStatusCode– 制限を超えたときに返される HTTP ステータスコード (デフォルト: 429)。
-
前提条件やアップグレード手順などの詳細については、以下のセクションを参照してください。
前提条件
カスタム証明書機能を使用するには、推論オペレーターの実行ロールに次のアクセス許可を追加します。
{ "Sid": "ACMCertificateAccess", "Effect": "Allow", "Action": [ "acm:DescribeCertificate", "acm:GetCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*" }
v3.1 へのアップグレード
Helm 経由で Inference Operator が既にインストールされている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
SageMaker HyperPod Inference リリースノート: Inference Operator v3.0
リリース日: 2026 年 2 月 23 日
[概要]
Inference Operator 3.0 では、ライフサイクル管理を簡素化するための EKS アドオン統合、詳細なスケジューリング制御のための Node Affinity サポート、リソースのタグ付けの改善が導入されています。既存の Helm ベースのインストールは、提供された移行スクリプトを使用して EKS アドオンに移行できます。アップグレードする前に、推論オペレーターの実行ロールを新しいタグ付けアクセス許可で更新します。
主な機能
-
EKS アドオン統合 — シンプルなインストールエクスペリエンスによるエンタープライズグレードのライフサイクル管理
-
ノードアフィニティ – スポットインスタンスの除外、アベイラビリティーゾーンの優先、カスタムラベルによるノードのターゲット設定のためのきめ細かなスケジューリング制御
前提条件、アップグレード手順、移行ガイダンスなどの詳細については、以下のセクションを参照してください。
前提条件
Helm バージョンを 3.0 にアップグレードする前に、推論演算子の実行ロールにタグ付けアクセス許可を追加する必要があります。リソースのタグ付けとセキュリティの向上の一環として、推論オペレーターは ALB、S3、および ACM リソースにタグ付けするようになりました。この機能強化には、推論演算子の実行ロールに追加のアクセス許可が必要です。推論演算子の実行ロールに次のアクセス許可を追加します。
{ "Sid": "CertificateTagginPermission", "Effect": "Allow", "Action": [ "acm:AddTagsToCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*", }, { "Sid": "S3PutObjectTaggingAccess", "Effect": "Allow", "Action": [ "s3:PutObjectTagging" ], "Resource": [ "arn:aws:s3:::<TLS_BUCKET>/*" # Replace * with your TLS bucket ] }
v3.0 へのアップグレード
Helm 経由で Inference Operator が既にインストールされている場合は、次のコマンドを使用してアップグレードします。
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.0 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Helm から EKS へのアドオン移行
3.0 バージョンより前に Helm 経由で推論演算子がインストールされている場合は、EKS アドオンに移行して、推論演算子用にリリースされる新機能をタイムリーに更新することをお勧めします。このスクリプトは、SageMaker HyperPod Inference Operator を Helm ベースのインストールから EKS アドオンインストールに移行します。
概要: スクリプトはクラスター名とリージョンをパラメータとして受け取り、既存の Helm インストール設定を取得し、EKS アドオンデプロイに移行します。これにより、推論オペレーター、ALB コントローラー、および KEDA オペレーターの新しい IAM ロールが作成されます。
Inference Operator を移行する前に、スクリプトは必要な依存関係 (S3 CSI ドライバー、FSx CSI ドライバー、cert-manager、および metrics-server) が存在することを確認します。存在しない場合は、アドオンとしてデプロイされます。
Inference Operator アドオンの移行が完了すると、スクリプトは S3、FSx、およびその他の依存関係 (ALB、KEDA、cert-manager、metrics-server) も移行します。を使用して--skip-dependencies-migration、S3 CSI ドライバー、FSx CSI ドライバー、cert-manager、および metrics-server のこのステップをスキップします。ALB と KEDA は、推論演算子と同じ名前空間のアドオンの一部としてインストールされ、推論演算子アドオンの一部として移行されることに注意してください。
重要
移行中は、移行が完了するまでデプロイされないため、新しいモデルをデプロイしないでください。Inference Operator アドオンが ACTIVE 状態になると、新しいモデルをデプロイできます。移行には通常 15~20 分かかり、現在デプロイされているモデルが少数しかない場合は 30 分以内に完了します。
移行の前提条件:
AWS CLI 適切な認証情報で設定されている
EKS クラスターへのアクセスで設定された kubectl
Helm のインストール
hyperpod-inference-operator の既存の Helm インストール
注記
すでに実行されているエンドポイントは、移行プロセス中に中断されません。既存のエンドポイントは、移行中も中断することなくトラフィックを引き続き処理します。
移行スクリプトの取得:
git clone https://github.com/aws/sagemaker-hyperpod-cli.git cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator/migration
使用:
./helm_to_addon.sh [OPTIONS] \ --cluster-name <cluster-name> (Required) \ --region <region> (Required) \ --helm-namespace kube-system (Optional) \ --auto-approve (Optional) \ --skip-dependencies-migration (Optional) \ --s3-mountpoint-role-arn <s3-mountpoint-role-arn> (Optional) \ --fsx-role-arn <fsx-role-arn> (Optional)
オプション:
--cluster-name NAME– EKS クラスター名 (必須)--region REGION– AWS リージョン (必須)--helm-namespace NAMESPACE– Helm チャートがインストールされている名前空間 (デフォルト: kube-system) (オプション)--s3-mountpoint-role-arn ARN– S3 Mountpoint CSI ドライバー IAM ロール ARN (オプション)--fsx-role-arn ARN– FSx CSI ドライバー IAM ロール ARN (オプション)--auto-approve– このフラグが有効になっている場合は確認プロンプトをスキップします。step-by-stepとauto-approveは相互に排他的です。--auto-approveが指定されている場合は、指定しないでください--step-by-step(オプション)--step-by-step– 主要な各ステップの後、レビューのために一時停止します。--auto-approveが既に追加されている場合、これは言及しないでください (オプション)--skip-dependencies-migration– Helm にインストールされた依存関係のアドオンへの移行をスキップします。依存関係が推論演算子 Helm チャートを介してインストールされなかった場合、または個別に管理する場合は (オプション)。
例:
基本的な移行 (依存関係を移行):
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1
プロンプトなしでの自動承認:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --auto-approve
FSx、S3 マウントポイント、証明書マネージャー、メトリクスサーバーの依存関係移行をスキップします。
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --skip-dependencies-migration
既存の S3 および FSx IAM ロールを指定します。
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --s3-mountpoint-role-arn arn:aws:iam::123456789012:role/s3-csi-role \ --fsx-role-arn arn:aws:iam::123456789012:role/fsx-csi-role
バックアップの場所:
バックアップは に保存されます。 /tmp/hyperpod-migration-backup-<timestamp>/
バックアップにより、安全な移行と復旧が可能になります。
失敗時のロールバック – 移行が失敗した場合、スクリプトはバックアップされた設定を使用してクラスターを移行前の状態に自動的に復元できます。
監査証跡 – トラブルシューティングとコンプライアンスのために、移行前に存在していたものの完全な記録を提供します。
設定リファレンス – 移行前と移行後の設定を比較できます
手動復旧 – 必要に応じて、バックアップディレクトリから特定のリソースを手動で検査および復元できます。
ロールバック:
移行が失敗した場合、スクリプトはロールバックを開始して以前の状態を復元する前に、ユーザーの確認を求めます。
SageMaker HyperPod Inference リリースノート: Inference Operator v2.3
最新情報
このリリースでは、デプロイ設定の柔軟性を高めるために、カスタムリソース定義 (CRDs) に新しいオプションフィールドが導入されました。
特徴
-
マルチインスタンスタイプ
-
デプロイの信頼性の向上 – 希望するオプションに容量がない場合、代替インスタンスタイプへの自動フェイルオーバーでマルチインスタンスタイプの設定をサポートします。
-
インテリジェントなリソーススケジューリング — Kubernetes ノードアフィニティを使用してインスタンスタイプに優先順位を付け、優先リソースが利用できない場合でもデプロイを保証します
-
コストとパフォーマンスの最適化 – インスタンスタイプの設定を維持し、クラスターの変動中の容量関連の障害を防止します。
-
バグ修正
の仕様invocationEndpointの フィールドへの変更が有効InferenceEndpointConfigになりました。
-
invocationEndpointフィールドがパッチ適用または更新されている場合、、Load BalancerIngress、、SageMakerEndpointRegistrationSageMaker エンドポイントなどの依存リソースは正規化で更新されます。 -
invocationEndpoint指定された の値は、InferenceEndpointConfig仕様自体にそのまま保存されます。この値を使用してLoad Balancerを作成し、有効にすると SageMaker エンドポイントを作成すると、スラッシュが先頭に 1 つ付くように正規化されます。-
v1/chat/completionsは、、AWS Load BalancerIngress、および SageMaker エンドポイント/v1/chat/completionsに対して に正規化されます。の場合SageMakerEndpointRegistration、仕様には として表示されますv1/chat/completions。 -
///invokeは、、AWS Load BalancerIngress、および SageMaker エンドポイント/invokeに対して に正規化されます。の場合SageMakerEndpointRegistration、仕様には として表示されますinvoke。
-
Helm のインストール:
フォロー: https://github.com/aws/sagemaker-hyperpod-cli/tree/main/helm_chart
推論演算子のインストールのみに重点を置いている場合は、ステップ 1、つまり の後Set Up Your Helm Environment、 を実行しますcd HyperPodHelmChart/charts/inference-operator。推論演算子チャートディレクトリ自体にあるため、 コマンドで が表示される場所であればhelm_chart/HyperPodHelmChart、 を . に置き換えます。
既にインストールされている場合は、オペレータを v2.3 にアップグレードします。
cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml helm upgrade hyperpod-inference-operator . \ -n kube-system \ -f current-values.yaml \ --set image.tag=v2.3