Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Note sulla versione di Amazon SageMaker HyperPod Inference
Questo argomento riguarda le note di rilascio che tengono traccia degli aggiornamenti, delle correzioni e delle nuove funzionalità per Amazon SageMaker HyperPod Inference. SageMaker HyperPod Inference ti consente di distribuire e scalare modelli di machine learning sui tuoi HyperPod cluster con un'affidabilità di livello aziendale. Per le versioni, gli aggiornamenti e i miglioramenti generali SageMaker HyperPod della piattaforma Amazon, consulta. Note di SageMaker HyperPod rilascio di Amazon
Per informazioni sulle funzionalità di SageMaker HyperPod inferenza e sulle opzioni di distribuzione, consulta. Distribuzione di modelli su Amazon SageMaker HyperPod
SageMaker HyperPod Note sulla versione di Inference: Inference Amazon EKS v2.0.0-eksbuild.2 e HyperPod Inference Operator v3.6
Data di uscita: 10 settembre 2026
Riepilogo
Il v2.0.0-eksbuild.2 rilascio del componente aggiuntivo HyperPod Inference Amazon EKS introduce HyperPod Inference Gateway Kubernetes-native, un livello di LLM-aware routing che distribuisce il traffico di inferenza tra pod che servono modelli utilizzando il contenuto del corpo della richiesta e la selezione degli endpoint. GPU-aware Sia l'Inference Operator che l'Inference Gateway vengono forniti insieme come parte di questa versione aggiuntiva.
Si tratta di un importante aggiornamento della versione del componente aggiuntivo, dal al. v1.6.0-eksbuild.1 v2.0.0-eksbuild.2 L'aggiornamento della versione riflette l'aggiunta di Inference Gateway e la versione rimane retrocompatibile con le funzionalità aggiuntive esistenti. Se non hai bisogno di nessuno dei componenti, puoi disabilitarlo nella configurazione del componente aggiuntivo impostando o su. inferenceGateway.enabled inferenceOperator.enabled false
Inference Gateway
-
Inference Gateway: indirizza il traffico di inferenza per più modelli attraverso un singolo endpoint gateway utilizzando tre livelli di routing: un Body-Based router che legge il
modelcampo di richiesta, il gateway con HttpRoute per il routing basato su intestazioni e un Endpoint Picker. GPU-aware Configura il gateway con il nuovoInferenceGatewayConfigCRD, compresi gli scheduler per modello, i punteggi, il supporto dell'adattatore LoRa e la terminazione TLS opzionale. Consulta Inference Gateway per Amazon Inference SageMaker HyperPod.
Operatore di inferenza
-
Integrazione del gateway su
InferenceEndpointConfigeJumpStartModel: aggiunto uninferenceGatewaycampo opzionale a entrambi i CRD. Imposta suinferenceGateway.enabledtrueper inserire un modello in un gateway condiviso. L'operatore aggiunge quindi una voce dello scheduler per quel modello a unInferenceGatewayConfig, creando il gateway se non esiste già.inferenceGateway.nameUsare per selezionare il gateway. I modelli che specificano lo stesso nome nello stesso namespace condividono un gateway e un nome non ancora in uso ne crea uno nuovo. Quando il campo è vuoto, l'operatore genera un nome univoco in modo che il modello abbia il proprio gateway. L'operatore rispecchia la disponibilità del gateway instatus.inferenceGateway. Per ulteriori informazioni, consulta Integrazione con l'operatore di HyperPod inferenza. -
Annotazioni personalizzate sui pod attivate
InferenceEndpointConfig: è stato aggiunto unpodTemplateAnnotationscampo opzionale in.spec.kubernetesL'operatore propaga queste annotazioni ai pod sottostanti, in modo che le integrazioni di pod-scraping come l'autodiscovery delle metriche possano leggerle.
Aggiornamento a v2.0.0-eksbuild.2 o v3.6
Modifiche allo schema di configurazione:
Lo schema di configurazione del componente aggiuntivo è stato modificato in questa versione. inferenceGatewayè stato aggiunto di recente e configura HyperPod Inference Gateway. Lo schema aggiunge inoltreinferenceOperator, il che offre la flessibilità di attivare o disattivare l'operatore di inferenza in modo indipendente. Entrambi i componenti sono abilitati per impostazione predefinita, con inferenceGateway.enabled e inferenceOperator.enabled impostati sutrue. Per disabilitare uno dei componenti, imposta il relativo enabled campo su false in--configuration-values.
Add-on Aggiornamento EKS:
Se hai installato l'Inference Operator come EKS Add-on, esegui l'aggiornamento v2.0.0-eksbuild.2 con il seguente comando:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION ACCOUNT=AWS_ACCOUNT_ID aws eks update-addon \ --cluster-name $CLUSTER --region $REGION \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v2.0.0-eksbuild.2 \ --resolve-conflicts OVERWRITE \ --configuration-values '{ "executionRoleArn": "arn:aws:iam::<ACCOUNT>:role/<EXEC_ROLE>", "tlsCertificateS3Bucket": "<TLS_BUCKET>", "inferenceOperator": { "enabled": true }, "inferenceGateway": { "enabled": true, "serviceAccount": { "roleArn": "arn:aws:iam::<ACCOUNT>:role/<CERT_ISSUER_ROLE>" } }, "keda": { "enabled": true, "auth": { "aws": { "irsa": { "enabled": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<KEDA_IRSA_ROLE>" } } } }, "alb": { "enabled": true, "serviceAccount": { "create": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<ALB_IRSA_ROLE>" } }, "jumpstartGatedModelDownloadRoleArn": "arn:aws:iam::<ACCOUNT>:role/<JUMPSTART_ROLE>" }'
Aggiornamento del timone:
Inference Gateway è disponibile solo tramite il componente aggiuntivo Amazon EKS. Se gestisci l'Inference Operator con Helm e desideri continuare a utilizzare funzionalità riservate agli operatori, aggiorna la versione di Helm con i seguenti comandi. Ti consigliamo di passare all'add-on per ottenere tutte le funzionalità sia di Inference Operator che di Inference Gateway.
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.6 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Per la migrazione da Helm al componente aggiuntivo Amazon EKS, consulta. Migrazione da Helm a EKS Add-on
SageMaker HyperPod Note sulla versione di Inference: Inference Amazon EKS v1.6.0-eksbuild.1 e HyperPod Inference Operator v3.5
Data di uscita: 3 settembre 2026
Riepilogo
Amazon SageMaker HyperPod Inference Operator v3.5 ti offre il controllo diretto su dove i pesi dei modelli sono prememorizzati nella cache. Ora puoi allegare le tue regole di affinità tra i nodi alla cache dei pesi invece di affidarti esclusivamente al tipo di istanza che l'operatore ricava dalla tua distribuzione. Questa versione aggiunge anche due metriche Prometheus per il volume delle richieste in entrata e include alcune correzioni di sicurezza.
Amazon SageMaker HyperPod Inference Operator v3.5 è disponibile in tutte le regioni in cui è supportato. AWS SageMaker HyperPod
Nuove funzionalità
-
Node Affinity for Model Weights Caching: limita i nodi che memorizzano nella cache i pesi del modello utilizzando il nuovo campo sotto sul tuo or.
nodeAffinitymodelCacheConfig.weightsCacheInferenceEndpointConfigJumpStartModelIl campo accetta la struttura di affinità dei nodi standard di Kubernetes, quindi ottieni termini e condizioni.requiredDuringSchedulingIgnoredDuringExecutionpreferredDuringSchedulingIgnoredDuringExecutionLa funzione MultiplenodeSelectorTermsfornisce la semantica OR, che consente di indirizzare pool di nodi, zone di disponibilità o set di etichette personalizzati in un'unica distribuzione.L'operatore applica le regole in aggiunta al tipo di destinazione di istanza da cui deriva
spec.instanceTypeorspec.instanceTypes, quindi i pesi vengono memorizzati nella cache solo sui nodi che soddisfano entrambi. Usalo per aggiungere la cache dei pesi a una singola zona di disponibilità o a gruppi di istanze specifici. HyperPod -
Monitoraggio delle richieste in entrata: due nuove metriche Prometheus offrono visibilità sul volume delle richieste di inferenza in entrata, in modo da poter misurare la domanda totale, tenere traccia del carico perso e pianificare di conseguenza la scalabilità automatica e la capacità.
-
model_requests_received_total— Conta ogni richiesta al punto di ingresso del proxy, prima di qualsiasi decisione di controllo dell'ammissione. Ciò include le richieste che vengono successivamente eliminate. -
model_requests_shed_total— Conta le richieste rifiutate dal controllo di ammissione tramite limitazione.
-
Aggiornamento a v3.5 o v1.6.0-eksbuild.1
Aggiornamento del timone:
Se hai già installato Inference Operator usando Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.5 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Aggiornamento EKS Add-on :
Se hai installato Inference Operator come EKS Add-on, esegui l'aggiornamento alla versione più recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.6.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Note sulla versione di Inference: Inference Amazon EKS v1.5.0-eksbuild.1 e HyperPod Inference Operator v3.4
Data di uscita: 21 agosto 2026
Riepilogo
Amazon SageMaker HyperPod Inference Operator v3.4 rende le richieste di risorse e i limiti dei container sidecar gestiti configurabili tramite il CRD. Ora puoi dimensionare il proxy inverso, il collettore di metriche e i contenitori di caricamento per l'acquisizione dei dati in base al tuo carico di lavoro invece di affidarti a valori predefiniti fissi.
Amazon SageMaker HyperPod Inference Operator v3.4 è disponibile in tutte le regioni in cui è supportato. AWS SageMaker HyperPod
Nuove funzionalità
-
Risorse per container configurabili: imposta le richieste e i limiti di risorse per i container sidecar gestiti dall'operatore. Usa i nuovi campi
metricsSidecarResourceses3UploaderResourcessulmetricsCollectorResourcestuo o.InferenceEndpointConfigJumpStartModelQuesti campi consentono di aumentare la memoria del proxy inverso per implementazioni ad alta concorrenza, ottimizzare il raccoglitore di metriche e dimensionare l'uploader di acquisizione dei dati. Quando viene impostato un campo, l'operatore applica i valori anziché i valori predefiniti incorporati e li conserva durante la riconciliazione. Ogni campo sostituisce completamente il blocco di risorse di quel contenitore, quindi specifica richieste e limiti completi.
Aggiornamento a v3.4 o v1.5.0-eksbuild.1
Aggiornamento del timone:
Se hai già installato Inference Operator usando Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.4 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Aggiornamento EKS Add-on :
Se hai installato Inference Operator come EKS Add-on, esegui l'aggiornamento alla versione più recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.5.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Note sulla versione di Inference: HyperPod Inference Amazon EKS v1.4.0-eksbuild.1 e Inference Operator v3.3
Data di uscita: 4 agosto 2026
Riepilogo
Amazon SageMaker HyperPod Inference Operator v3.3 introduce il caching del modello locale sull'host. Ciò riduce la latenza di avvio a freddo quando si ridimensiona una distribuzione di inferenza. Questa versione rende inoltre il timeout di inattività dell'Application Load Balancer configurabile per ogni distribuzione.
Amazon SageMaker HyperPod Inference Operator v3.3 è disponibile in tutte le regioni in cui è supportato. AWS SageMaker HyperPod
Nuove funzionalità
-
Pesi del modello e caching delle immagini: il modello memorizza i pesi nella cache sullo storage NVMe locale del nodo e precarica l'immagine del contenitore del server di inferenza sui nodi di destinazione. I pod aggiunti durante lo scale-out non scaricano pesi da Amazon S3 o Amazon FSx. Non aspettano che l'immagine venga estratta a freddo. Attivate uno dei due meccanismi indipendentemente o entrambi insieme utilizzando
modelCacheConfignel vostro CRD. Questa funzionalità richiede un tipo di istanza con storage NVMe locale. Consulta pesi del modello, memorizzazione nella cache e memorizzazione nella cache delle immagini. -
Timeout di inattività ALB configurabile: controlla per quanto tempo l'Application Load Balancer mantiene aperta una connessione inattiva utilizzando on your or.
loadBalancer.idleTimeoutSecondsInferenceEndpointConfigJumpStartModelI valori validi sono 1—4000 secondi e il valore predefinito è 60 secondi. Aumenta questo valore per le distribuzioni le cui richieste richiedono più tempo del tempo predefinito per restituire una risposta.
Correzioni di bug
-
Servizio di routing mancante: è stato risolto un problema per cui una riconciliazione iniziale interrotta poteva lasciare una distribuzione senza il servizio di routing Kubernetes. Questo servizio supporta l'Ingress e il load balancer della distribuzione. Gli endpoint hanno restituito risposte HTTP 503 mentre tutti i segnali sullo stato di salute sono risultati integri. L'operatore ora ricrea il servizio di routing quando manca.
-
Intelligent Routing Endpoint Registration: è stato risolto un problema per cui le implementazioni di routing intelligente utilizzavano un nome senza prefisso per la ricerca del percorso di ingresso. La ricerca non è riuscita ad ogni riconciliazione, il che ha impedito il completamento della registrazione degli endpoint AI. SageMaker
-
Configurazione della cache KV: è stato risolto un problema per cui l'operatore non rispettava o non effettuava l'accesso.
enableL1CacheenableL2CachefalsekvCacheSpec
Aggiornamento a v3.3 o v1.4.0-eksbuild.1
Aggiornamento del timone:
Se hai già installato Inference Operator usando Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.3 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Aggiornamento EKS Add-on :
Se hai installato Inference Operator come EKS Add-on, esegui l'aggiornamento alla versione più recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.4.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Note sulla versione di Inference: HyperPod Inference Amazon EKS v1.3.0-eksbuild.1 e Inference Operator v3.2
Data di uscita: 12 giugno 2026
Riepilogo
Inference Operator v3.2 consente ai clienti di implementare LLM a lungo contesto (come Llama 3.3 70B) con una latenza prevedibile per token in caso di carico simultaneo. La versione introduce Disaggregated Prefill and Decode (DPD), che separa la fase di precompilazione associata al calcolo e la fase di decodifica legata alla larghezza di banda di memoria in pool di GPU distinti e trasferisce la cache KV tra di loro tramite EFA con RDMA. GPU-Direct DPD riduce la latenza tail per token, aumenta il throughput e consente di scalare la capacità di precompilazione e decodifica in modo indipendente. Oltre a DPD, in questa versione sono incluse altre correzioni di bug.
Caratteristiche principali
Precompilazione e decodifica disaggregati (DPD)
-
È stato aggiunto un nuovo
pdSpeccampo alInferenceEndpointConfigCRD che consente l'inferenza disaggregata. QuandopdSpecè impostato, l'operatore fornisce pod di precompilazione e decodificazione separati, li collega tramite il router DPD e trasferisce la cache KV tra di essi utilizzando LMCache su NIXL ed EFA con RDMA. GPU-Direct Alcuni esempi di campi configurabili includono (ulteriori informazioni sulla configurazione possono consultare la guida per l'utente):-
routingThreshold— Token-length soglia al di sopra della quale le richieste utilizzano il percorso disaggregato. Al di sotto della soglia, le richieste bypassano il precompilatore e vanno direttamente al decodificatore. -
prefillSpec.argsedecodingSpec.args— i flag Per-role vLLM sono stati uniti all'avvio.worker.args -
prefillSpec.replicasedecodingSpec.replicas— Scala la capacità di precompilazione e decodifica in modo indipendente per adattarla alla distribuzione della lunghezza di input e output del carico di lavoro.
-
-
Prerequisito
-
Per implementare gli endpoint DPD, i nodi del cluster devono supportare EFA con lettura e scrittura RDMA e trovarsi all'interno della stessa zona di disponibilità per la comunicazione da nodo a nodo a larghezza di banda elevata.
-
Famiglie
ml.p5.48xlargeml.p5e.48xlargeml.p5en.48xlargediml.p6-b200.48xlargeml.p6-b300.48xlargeistanze consigliate:,,,,.
-
Correzioni di bug
-
Pianificazione dell'operatore sui nodi x86: la distribuzione da parte dell'operatore ora viene utilizzata solo
nodeAffinityper la pianificazione sui nodi Linux amd64. -
Includiamo altre correzioni minori e di sicurezza.
Aggiornamento a v3.2 o v1.3.0-eksbuild.1
Aggiornamento del timone:
Se hai già installato Inference Operator tramite Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Aggiornamento EKS Add-on :
Se hai installato Inference Operator come EKS Add-on, esegui l'aggiornamento alla versione più recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.3.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Note sulla versione di Inference: Inference Amazon EKS v1.2.0-eksbuild.1 e HyperPod Inference Operator v3.1.2
Data di uscita: 6 maggio 2026
Riepilogo
Inference Operator v3.1.2 introduce l'acquisizione dei dati di inferenza per la registrazione del traffico degli endpoint, l'integrazione HuggingFace Hub per l'implementazione diretta del modello, la gestione DNS Route 53 per domini personalizzati, l'implementazione del modello NVMe locale per ridurre la latenza di avvio a freddo e account di servizio personalizzati con supporto IRSA.
Nuove funzionalità
-
Acquisizione dati di inferenza: registra input e output in tre punti di acquisizione: endpoint SageMaker AI, load balancer (log di accesso ALB) e pod modello. Abilita qualsiasi combinazione tramite il tuo CRD.
dataCaptureConsulta Acquisizione di dati per inferenza su HyperPod. -
HuggingFace Model Source: implementa i modelli direttamente da HuggingFace Hub senza pre-staging su S3 o FSx. Supporta i modelli gated tramite, il blocco delle revisioni tramite
tokenSecretRefe l'isolamento dei token.commitSHACompatibile con i runtime vLLM, TGI e SGlang. Consulta Distribuisci modelli da Amazon S3, Amazon FSx o Hugging Face Hub usando kubectl. -
Gestione DNS Route 53: crea e gestisci automaticamente i record DNS per domini personalizzati tramite.
dnsConfigConsulta Certificati personalizzati e gestione DNS Route 53 per Inference HyperPod. -
Implementazione del modello NVMe locale: carica i pesi del modello dallo storage NVMe locale del nodo per ridurre la latenza di avvio a freddo.
modelSourceType: kubernetesVolumeSupporta il fallback su S3. Consulta Implementa modelli dallo storage NVMe locale usando kubectl. -
Account di servizio personalizzati: assegna i pod di inferenza personalizzati ServiceAccounts con supporto IRSA tramite.
spec.kubernetes.serviceAccountName
Correzioni di bug
-
Propagazione dei tag: i User-defined tag attivi
InferenceEndpointConfigora si propagano correttamente alSageMakerEndpointRegistrationCRD e alle risorse AI a valle. SageMaker In precedenza, i tag non venivano trasmessi durante la creazione o gli aggiornamenti della registrazione degli endpoint. -
Conservazione delle repliche con scalabilità automatica: è stato risolto un problema per cui l'aggiornamento di un
InferenceEndpointConfigORJumpStartModelCR reimpostava il conteggio delle repliche al valore della specifica, sovrascrivendo il conteggio delle repliche corrente. HPA/KEDA-managed L'operatore ora conserva il conteggio delle repliche attive durante gli aggiornamenti CR. -
Convalida CRD con scalabilità automatica: è stata corretta l'espressione regolare di
prometheusTrigger.serverAddressconvalida che richiedeva erroneamente un segmento di percorso finale, causando errori 404 quando KEDA veniva aggiunto all'URL dello spazio di lavoro AMP./api/v1/query -
Rotazione dei certificati: è stato corretto il problema della rotazione dei certificati personalizzati che non si propagava ad ALB dopo il riavvio del pod dell'operatore.
Aggiornamento a v3.1.2 o v1.2.0-eksbuild.1
Aggiornamento del timone:
Se hai già installato Inference Operator tramite Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Aggiornamento EKS Add-on :
Se hai installato Inference Operator come EKS Add-on, esegui l'aggiornamento alla versione più recente.
Innanzitutto, controlla se hyperpodClusterArn è già presente nella configurazione del componente aggiuntivo:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text | jq .
Se hyperpodClusterArn è presente nell'output, esegui il seguente comando per eseguire l'aggiornamento:
aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
Se non hyperpodClusterArn è presente, recupera la configurazione corrente, aggiungila e aggiorna:
HP_ARN=HYPERPOD_CLUSTER_ARN CURRENT_CONFIG=$(aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text) # Add hyperpodClusterArn to the configuration NEW_CONFIG=$(echo "$CURRENT_CONFIG" | jq --arg arn "$HP_ARN" \ '. + {hyperpodClusterArn: $arn}') aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --configuration-values "$NEW_CONFIG" \ --resolve-conflicts OVERWRITE \ --region $REGION
Attendi che il componente aggiuntivo diventi attivo prima di distribuire i modelli.
SageMaker HyperPod Note sulla versione di Inference: Inference Operator v3.1
Data di uscita: 3 aprile 2026
Riepilogo
Inference Operator v3.1 introduce la configurazione personalizzata dei pod Kubernetes, il supporto personalizzato per i certificati e i limiti di richiesta per pod.
Caratteristiche principali
-
Configurazione personalizzata dei pod Kubernetes: aggiunto un nuovo
kubernetescampo alInferenceEndpointConfigCRD che consente agli utenti di personalizzare le configurazioni dei pod di inferenza:-
Contenitori di inizializzazione personalizzati: esegui contenitori init definiti dall'utente prima dell'avvio del server di inferenza (ad esempio, riscaldamento della cache, configurazione GDS). I contenitori Init vengono iniettati dopo il contenitore di prefetch dell'operatore.
-
Volumi personalizzati: aggiungi volumi aggiuntivi (
emptyDir,,hostPathconfigMap, ecc.) alle specifiche del pod, a cui possono essere referenziati dai contenitori init tramite.volumeMounts -
Nome dello scheduler personalizzato: specifica uno scheduler Kubernetes personalizzato per il posizionamento dei pod.
-
-
Certificati personalizzati: utilizza i tuoi certificati ACM per gli endpoint di inferenza anziché i certificati autofirmati generati dall'operatore, configurati tramite.
customCertificateConfigSupporta certificati ACM affidabili pubblicamente, certificati CA AWS privati e certificati importati da CA esterne. L'operatore monitora lo stato dei certificati e supporta il rilevamento automatico dei rinnovi. -
Limiti delle richieste: controlla la gestione delle richieste per pod tramite la nuova
RequestLimitsconfigurazione inWorkerbasso, con i seguenti campi configurabili:-
maxConcurrentRequests— Numero massimo di richieste simultanee in volo per pod. -
maxQueueSize— Richieste di messa in coda quando viene raggiunto il limite di concorrenza prima del rifiuto. -
overflowStatusCode— Codice di stato HTTP restituito quando vengono superati i limiti (impostazione predefinita: 429).
-
Per informazioni dettagliate, inclusi i prerequisiti e le istruzioni di aggiornamento, consulta le sezioni seguenti.
Prerequisiti
Per utilizzare la funzionalità Certificati personalizzati, aggiungete le seguenti autorizzazioni al ruolo di esecuzione di Inference Operator:
{ "Sid": "ACMCertificateAccess", "Effect": "Allow", "Action": [ "acm:DescribeCertificate", "acm:GetCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*" }
Aggiornamento alla v3.1
Se hai già installato Inference Operator tramite Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
SageMaker HyperPod Note sulla versione di Inference: Inference Operator v3.0
Data di uscita: 23 febbraio 2026
Riepilogo
Inference Operator 3.0 introduce l' Add-on integrazione EKS per una gestione semplificata del ciclo di vita, il supporto di Node Affinity per il controllo granulare della pianificazione e una migliore etichettatura delle risorse. Helm-based Le installazioni esistenti possono essere migrate a EKS utilizzando lo script di migrazione fornito. Add-on Aggiorna il tuo ruolo di esecuzione di Inference Operator con nuove autorizzazioni di tagging prima dell'aggiornamento.
Caratteristiche principali
-
Add-on Integrazione EKS: gestione Enterprise-grade del ciclo di vita con esperienza di installazione semplificata
-
Node Affinity: controllo granulare della pianificazione per escludere le istanze spot, preferire le zone di disponibilità o indirizzare i nodi con etichette personalizzate
Per informazioni dettagliate, tra cui prerequisiti, istruzioni per l'aggiornamento e linee guida sulla migrazione, consulta le sezioni seguenti.
Prerequisiti
Prima di aggiornare la versione Helm alla 3.0, i clienti devono aggiungere ulteriori autorizzazioni di tagging al proprio ruolo di esecuzione dell'operatore Inference. Come parte del miglioramento della codifica e della sicurezza delle risorse, l'Inference Operator ora assegna tag alle risorse ALB, S3 e ACM. Questo miglioramento richiede autorizzazioni aggiuntive nel ruolo di esecuzione di Inference Operator. Aggiungi le seguenti autorizzazioni al tuo ruolo di esecuzione di Inference Operator:
{ "Sid": "CertificateTagginPermission", "Effect": "Allow", "Action": [ "acm:AddTagsToCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*", }, { "Sid": "S3PutObjectTaggingAccess", "Effect": "Allow", "Action": [ "s3:PutObjectTagging" ], "Resource": [ "arn:aws:s3:::<TLS_BUCKET>/*" # Replace * with your TLS bucket ] }
Esegui l'aggiornamento alla v3.0
Se hai già installato Inference Operator tramite Helm, usa i seguenti comandi per l'aggiornamento:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.0 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Migrazione da Helm a EKS Add-on
Se Inference operator è installato tramite Helm prima della versione 3.0, consigliamo di migrare a EKS per Add-on ottenere aggiornamenti tempestivi sulle nuove funzionalità che verranno rilasciate per Inference Operator. Questo script migra l' SageMaker HyperPod Inference Operator dall'installazione all'installazione di EKS. Helm-based Add-on
Panoramica: lo script accetta il nome e la regione del cluster come parametri, recupera la configurazione di installazione di Helm esistente e migra alla distribuzione EKS. Add-on Crea nuovi ruoli IAM per Inference Operator, ALB Controller e KEDA Operator.
Prima di migrare l'Inference Operator, lo script garantisce l'esistenza delle dipendenze richieste (driver S3 CSI, driver FSx CSI, cert-manager e metrics-server). Se non esistono, li distribuisce come. Add-on
Una volta completata la Add-on migrazione di Inference Operator, lo script migra anche S3, FSx e altre dipendenze (ALB, KEDA, cert-manager, metrics-server) se sono state originariamente installate tramite il grafico Inference Operator Helm. Usalta questo passaggio per il driver S3 CSI, il driver --skip-dependencies-migration FSx CSI, il cert-manager e il metrics-server. Nota che ALB e KEDA sono installati come parte dello stesso namespace di Inference Operator e Add-on verranno migrati come parte di Inference Operator. Add-on
Importante
Durante la migrazione, non implementate nuovi modelli poiché non verranno distribuiti fino al completamento della migrazione. Una volta che l'Inference Operator Add-on è in stato ATTIVO, è possibile implementare nuovi modelli. Il tempo di migrazione richiede in genere dai 15 ai 20 minuti e può essere completato entro 30 minuti se sono attualmente distribuiti solo pochi modelli.
Prerequisiti per la migrazione:
AWS CLI configurato con le credenziali appropriate
kubectl configurato con accesso al tuo cluster EKS
Helm installato
Installazione Helm esistente di hyperpod-inference-operator
Nota
Gli endpoint già in esecuzione non verranno interrotti durante il processo di migrazione. Gli endpoint esistenti continueranno a servire il traffico senza interruzioni durante tutta la migrazione.
Ottenere lo script di migrazione:
git clone https://github.com/aws/sagemaker-hyperpod-cli.git cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator/migration
Utilizzo:
./helm_to_addon.sh [OPTIONS] \ --cluster-name <cluster-name> (Required) \ --region <region> (Required) \ --helm-namespace kube-system (Optional) \ --auto-approve (Optional) \ --skip-dependencies-migration (Optional) \ --s3-mountpoint-role-arn <s3-mountpoint-role-arn> (Optional) \ --fsx-role-arn <fsx-role-arn> (Optional)
Opzioni:
--cluster-name NAME— nome del cluster EKS (obbligatorio)--region REGION— AWS regione (obbligatorio)--helm-namespace NAMESPACE— Namespace in cui è installato Helm chart (predefinito: kube-system) (opzionale)--s3-mountpoint-role-arn ARN— Ruolo IAM ARN del driver S3 Mountpoint CSI (opzionale)--fsx-role-arn ARN— Ruolo IAM del driver FSx CSI ARN (opzionale)--auto-approve— Ignora le richieste di conferma se questo flag è abilitato.step-by-stepeauto-approvesi escludono a vicenda, se indicato,--auto-approvenon specificarlo (opzionale)--step-by-step--step-by-step— Fai una pausa dopo ogni passaggio principale per la revisione. Questo non dovrebbe essere menzionato se--auto-approveè già stato aggiunto (opzionale)--skip-dependencies-migration— Salta la migrazione delle Helm-installed dipendenze a. Add-on Perché le dipendenze NON sono state installate tramite il grafico Inference Operator Helm o se si desidera gestirle separatamente. (opzionale)
Esempi:
Migrazione di base (migra le dipendenze):
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1
Auto-approve senza istruzioni:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --auto-approve
Salta la migrazione delle dipendenze per FSx, S3 mountpoint, cert manager e Metrics server:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --skip-dependencies-migration
Fornisci i ruoli IAM S3 e FSx esistenti:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --s3-mountpoint-role-arn arn:aws:iam::123456789012:role/s3-csi-role \ --fsx-role-arn arn:aws:iam::123456789012:role/fsx-csi-role
Ubicazione del backup:
I backup sono archiviati in /tmp/hyperpod-migration-backup-<timestamp>/
I backup consentono una migrazione e un ripristino sicuri:
Rollback in caso di errore: se la migrazione fallisce, lo script può ripristinare automaticamente il cluster allo stato precedente alla migrazione utilizzando le configurazioni di backup
Audit Trail: fornisce una registrazione completa di ciò che esisteva prima della migrazione per la risoluzione dei problemi e la conformità
Riferimento alla configurazione: consente di confrontare le configurazioni precedenti e successive alla migrazione
Ripristino manuale: se necessario, è possibile ispezionare e ripristinare manualmente risorse specifiche dalla directory di backup
Rollback:
Se la migrazione non riesce, lo script richiede la conferma dell'utente prima di avviare il rollback per ripristinare lo stato precedente.
SageMaker HyperPod Note sulla versione di Inference: Inference Operator v2.3
Cosa c'è di nuovo
Questa versione introduce nuovi campi opzionali nelle Custom Resource Definitions (CRD) per migliorare la flessibilità di configurazione della distribuzione.
Funzionalità
-
Tipi di istanza multipla
-
Maggiore affidabilità di distribuzione: supporta configurazioni di tipo multiistanza con failover automatico su tipi di istanza alternativi quando le opzioni preferite non hanno capacità
-
Pianificazione intelligente delle risorse: utilizza l'affinità tra i nodi Kubernetes per dare priorità ai tipi di istanza garantendo al contempo l'implementazione anche quando le risorse preferite non sono disponibili
-
Costi e prestazioni ottimizzati: mantiene le preferenze relative al tipo di istanza e previene i guasti legati alla capacità durante le fluttuazioni del cluster
-
Correzioni di bug
Le modifiche al campo invocationEndpoint nelle specifiche di ora avranno effetto: InferenceEndpointConfig
-
Se il
invocationEndpointcampo è patchato o aggiornato, le risorse dipendenti, come Load Balancer ed SageMaker EndpointSageMakerEndpointRegistration, verranno aggiornate con la normalizzazione.Ingress -
Il valore
invocationEndpointfornito verrà archiviato così com'è nella specifica stessa.InferenceEndpointConfigQuando questo valore viene utilizzato per creare un Load Balancer e, se abilitato, un SageMaker Endpoint, verrà normalizzato in modo da avere una barra iniziale.-
v1/chat/completionsverrà normalizzato/v1/chat/completionsper AWS Load Balancer edIngressEndpoint. SageMaker Per ilSageMakerEndpointRegistration, verrà visualizzato nelle sue specifiche come.v1/chat/completions -
///invokesarà normalizzato/invokeper AWS Load Balancer ed Endpoint.IngressSageMaker Per ilSageMakerEndpointRegistration, verrà visualizzato nelle sue specifiche come.invoke
-
Installazione di Helm:
Segui: https://github.com/aws/sagemaker-hyperpod-cli/tree/main/helm_chart
Se ti concentri solo sull'installazione dell'operatore di inferenza, dopo il passaggio 1, ad esempioSet Up Your Helm Environment, cd HyperPodHelmChart/charts/inference-operator esegui. Dato che vi trovate nella cartella stessa del grafico degli operatori di inferenza, nei comandi, ovunque vediatehelm_chart/HyperPodHelmChart, sostituite con. .
Aggiorna Operator alla v2.3 nel caso in cui sia già installato:
cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml helm upgrade hyperpod-inference-operator . \ -n kube-system \ -f current-values.yaml \ --set image.tag=v2.3