As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Notas de lançamento do Amazon SageMaker HyperPod Inference
Este tópico aborda notas de lançamento que acompanham atualizações, correções e novos recursos do Amazon SageMaker HyperPod Inference. SageMaker HyperPod A inferência permite que você implante e escale modelos de aprendizado de máquina em seus HyperPod clusters com confiabilidade de nível corporativo. Para lançamentos, atualizações e melhorias gerais da SageMaker HyperPod plataforma Amazon, consulteNotas SageMaker HyperPod de lançamento da Amazon.
Para obter informações sobre os recursos de SageMaker HyperPod inferência e as opções de implantação, consulteImplantação de modelos na Amazon SageMaker HyperPod.
SageMaker HyperPod Notas de lançamento do Inference: HyperPod Inference Amazon EKS v2.0.0-eksbuild.2 e Inference Operator v3.6
Data de lançamento: 10 de setembro de 2026
Resumo
O v2.0.0-eksbuild.2 lançamento do complemento HyperPod Inference Amazon EKS apresenta o Inference Gateway, uma Kubernetes-native camada de LLM-aware roteamento que distribui o tráfego de HyperPod inferência entre os pods que atendem modelos usando o conteúdo do corpo da solicitação e a seleção de endpoints. GPU-aware Tanto o Inference Operator quanto o Inference Gateway são fornecidos juntos como parte dessa versão adicional.
Esta é uma grande atualização da versão do complemento, v1.6.0-eksbuild.1 de a. v2.0.0-eksbuild.2 A atualização da versão reflete a adição do Inference Gateway, e a versão permanece retrocompatível com os recursos adicionais existentes. Se você não precisar de nenhum componente, poderá desativá-lo na configuração do complemento definindo inferenceGateway.enabled ou inferenceOperator.enabled parafalse.
Gateway de inferência
-
Gateway de inferência — Roteie o tráfego de inferência para vários modelos por meio de um único endpoint de gateway usando três camadas de roteamento: um Body-Based roteador que lê o
modelcampo de solicitação, o gateway com HttpRoute para roteamento baseado em cabeçalho e um seletor de endpoint. GPU-aware Configure o gateway com o novoInferenceGatewayConfigCRD, incluindo agendadores por modelo, pesos de pontuação, suporte ao adaptador LoRa e terminação TLS opcional. Consulte Gateway de inferência para Amazon SageMaker HyperPod Inference.
Operador de inferência
-
Integração de gateway em
InferenceEndpointConfigeJumpStartModel— Adicionado uminferenceGatewaycampo opcional aos dois CRDs.inferenceGateway.enabledDefina comotruepara optar por um modelo em um gateway compartilhado. O operador então adiciona uma entrada do agendador para esse modelo a umInferenceGatewayConfig, criando o gateway se ele ainda não existir. UseinferenceGateway.namepara selecionar o gateway. Modelos que especificam o mesmo nome no mesmo namespace compartilham um gateway, e um nome que ainda não está em uso cria um novo. Quando o campo está vazio, o operador gera um nome exclusivo para que o modelo tenha seu próprio gateway. O operador reflete a prontidão do gateway.status.inferenceGatewayPara obter mais informações, consulte Integração com o operador de HyperPod inferência. -
Anotações personalizadas do pod ativadas
InferenceEndpointConfig— Foi adicionado umpodTemplateAnnotationscampo opcional em.spec.kubernetesO operador propaga essas anotações para os pods subjacentes, para que integrações de extração de pods, como a descoberta automática de métricas, possam lê-las.
Atualize para v2.0.0-eksbuild.2 ou v3.6
Alterações no esquema de configuração:
O esquema de configuração do complemento foi alterado nesta versão. inferenceGatewayfoi adicionado recentemente e configura o HyperPod Inference Gateway. O esquema também adicionainferenceOperator, o que lhe dá a flexibilidade de ativar ou desativar o operador de inferência de forma independente. Ambos os componentes são ativados por padrão, com inferenceGateway.enabled e inferenceOperator.enabled definidos comotrue. Para desativar qualquer componente, defina seu enabled campo como false in--configuration-values.
Add-on Atualização do EKS:
Se você instalou o Inference Operator como um EKS Add-on, atualize-o v2.0.0-eksbuild.2 com o seguinte comando:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION ACCOUNT=AWS_ACCOUNT_ID aws eks update-addon \ --cluster-name $CLUSTER --region $REGION \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v2.0.0-eksbuild.2 \ --resolve-conflicts OVERWRITE \ --configuration-values '{ "executionRoleArn": "arn:aws:iam::<ACCOUNT>:role/<EXEC_ROLE>", "tlsCertificateS3Bucket": "<TLS_BUCKET>", "inferenceOperator": { "enabled": true }, "inferenceGateway": { "enabled": true, "serviceAccount": { "roleArn": "arn:aws:iam::<ACCOUNT>:role/<CERT_ISSUER_ROLE>" } }, "keda": { "enabled": true, "auth": { "aws": { "irsa": { "enabled": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<KEDA_IRSA_ROLE>" } } } }, "alb": { "enabled": true, "serviceAccount": { "create": true, "roleArn": "arn:aws:iam::<ACCOUNT>:role/<ALB_IRSA_ROLE>" } }, "jumpstartGatedModelDownloadRoleArn": "arn:aws:iam::<ACCOUNT>:role/<JUMPSTART_ROLE>" }'
Atualização do leme:
O Inference Gateway está disponível somente por meio do complemento Amazon EKS. Se você gerencia o Inference Operator com o Helm e deseja continuar usando recursos somente para operadores, atualize sua versão do Helm com os seguintes comandos. Recomendamos migrar para o complemento para obter todos os recursos do Inference Operator e do Inference Gateway.
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.6 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Para migrar do Helm para o complemento Amazon EKS, consulte. Migração do Helm para o EKS Add-on
SageMaker HyperPod Notas de lançamento do Inference: HyperPod Inference Amazon EKS v1.6.0-eksbuild.1 e Inference Operator v3.5
Data de lançamento: 3 de setembro de 2026
Resumo
O Amazon SageMaker HyperPod Inference Operator v3.5 oferece controle direto sobre onde os pesos do modelo são pré-armazenados em cache. Agora você pode anexar suas próprias regras de afinidade de nós ao cache de pesos em vez de depender apenas do tipo de instância que o operador obtém de sua implantação. Esta versão também adiciona duas métricas do Prometheus para o volume de solicitações de entrada e inclui algumas correções de segurança.
O Amazon SageMaker HyperPod Inference Operator v3.5 está disponível em todas as AWS regiões onde SageMaker HyperPod há suporte.
Novos atributos
-
Afinidade de nós para armazenamento em cache de pesos de modelo — Restrinja quais nós pré-armazenam os pesos do modelo em cache usando o novo campo abaixo em seu ou.
nodeAffinitymodelCacheConfig.weightsCacheInferenceEndpointConfigJumpStartModelO campo aceita a estrutura de afinidade de nós padrão do Kubernetes, então você obtém os termos e.requiredDuringSchedulingIgnoredDuringExecutionpreferredDuringSchedulingIgnoredDuringExecutionVáriosnodeSelectorTermsfornecem semântica OR, o que permite direcionar grupos de nós, zonas de disponibilidade ou conjuntos de rótulos personalizados em uma implantação.O operador aplica suas regras além da segmentação por tipo de instância da qual deriva
spec.instanceTypeouspec.instanceTypes, portanto, os pesos são armazenados em cache somente nos nós que satisfazem ambas. Use isso para fixar o cache de pesos em uma única zona de disponibilidade ou em grupos de HyperPod instâncias específicos. -
Rastreamento de solicitações de entrada — Duas novas métricas do Prometheus oferecem visibilidade do volume de solicitações de inferência de entrada, para que você possa medir a demanda total, rastrear a carga do galpão e planejar adequadamente o escalonamento automático e a capacidade.
-
model_requests_received_total— Conta cada solicitação no ponto de entrada do proxy, antes de qualquer decisão de controle de admissão. Isso inclui solicitações que são eliminadas posteriormente. -
model_requests_shed_total— Conta as solicitações rejeitadas pelo controle de admissão por meio de limitação.
-
Atualize para v3.5 ou v1.6.0-eksbuild.1
Atualização do leme:
Se você já tiver o Inference Operator instalado usando o Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.5 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Add-on Atualização do EKS:
Se você instalou o Inference Operator como um EKS Add-on, atualize para a versão mais recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.6.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Notas de lançamento do Inference: HyperPod Inference Amazon EKS v1.5.0-eksbuild.1 e Inference Operator v3.4
Data de lançamento: 21 de agosto de 2026
Resumo
O Amazon SageMaker HyperPod Inference Operator v3.4 torna as solicitações de recursos e os limites dos contêineres secundários gerenciados configuráveis por meio do CRD. Agora você pode dimensionar o proxy reverso, o coletor de métricas e os contêineres do carregador de captura de dados para corresponder à sua carga de trabalho, em vez de depender de padrões fixos.
O Amazon SageMaker HyperPod Inference Operator v3.4 está disponível em todas as AWS regiões onde SageMaker HyperPod há suporte.
Novos atributos
-
Recursos de contêiner configuráveis — Defina solicitações e limites de recursos para os contêineres secundários gerenciados pelo operador. Use os
s3UploaderResourcescampos novosmetricsSidecarResourcesmetricsCollectorResources,, e em seuInferenceEndpointConfigouJumpStartModel. Esses campos permitem aumentar a memória proxy reversa para implantações de alta simultaneidade, ajustar o coletor de métricas e dimensionar o carregador de captura de dados. Quando um campo é definido, o operador aplica seus valores em vez dos padrões incorporados e os preserva durante a reconciliação. Cada campo substitui totalmente o bloco de recursos desse contêiner, portanto, especifique solicitações e limites completos.
Atualize para v3.4 ou v1.5.0-eksbuild.1
Atualização do leme:
Se você já tiver o Inference Operator instalado usando o Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.4 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Add-on Atualização do EKS:
Se você instalou o Inference Operator como um EKS Add-on, atualize para a versão mais recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.5.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Notas de lançamento do Inference: HyperPod Inference Amazon EKS v1.4.0-eksbuild.1 e Inference Operator v3.3
Data de lançamento: 4 de agosto de 2026
Resumo
O Amazon SageMaker HyperPod Inference Operator v3.3 apresenta o armazenamento em cache do modelo local do host. Isso reduz a latência de inicialização a frio quando você expande uma implantação de inferência. Essa versão também torna o tempo limite de inatividade do Application Load Balancer configurável para cada implantação.
O Amazon SageMaker HyperPod Inference Operator v3.3 está disponível em todas as AWS regiões onde SageMaker HyperPod há suporte.
Novos atributos
-
Pesos do modelo e armazenamento em cache de imagens — Armazene os pesos do modelo no armazenamento NVMe local do nó e extraia previamente a imagem do contêiner do servidor de inferência para os nós de destino. Os pods adicionados durante a expansão não baixam pesos do Amazon S3 ou do Amazon FSx. Eles não esperam por uma imagem fria. Ative um dos mecanismos de forma independente ou os dois juntos usando
modelCacheConfigem seu CRD. Esse recurso exige um tipo de instância com armazenamento NVMe local. Consulte Armazenamento em cache de pesos de modelos e cache de imagens. -
Tempo limite de inatividade configurável do ALB — Controle por quanto tempo o Application Load Balancer mantém uma conexão inativa aberta usando em seu ou.
loadBalancer.idleTimeoutSecondsInferenceEndpointConfigJumpStartModelOs valores válidos são de 1 a 4000 segundos e o padrão é 60 segundos. Aumente esse valor para implantações cujas solicitações demoram mais do que o padrão para retornar uma resposta.
Correções de bugs
-
Serviço de roteamento ausente — Corrigido um problema em que uma reconciliação inicial interrompida poderia deixar uma implantação sem o serviço de roteamento Kubernetes. Esse serviço oferece suporte ao Ingress e ao balanceador de carga da implantação. Os endpoints retornaram respostas HTTP 503, enquanto todos os sinais de saúde foram relatados como saudáveis. O operador agora recria o serviço de roteamento quando ele está ausente.
-
Registro de endpoint de roteamento inteligente — corrigido um problema em que as implantações de roteamento inteligente usavam um nome sem prefixo para a pesquisa do caminho de entrada. A pesquisa falhou em todas as reconciliações, o que impediu a conclusão do registro de endpoints de SageMaker IA.
-
Configuração de cache KV — Corrigido um problema em que o operador não respeitava
enableL1CachenemenableL2Cacheconfigurava a opçãofalsedekvCacheSpecentrada.
Atualize para v3.3 ou v1.4.0-eksbuild.1
Atualização do leme:
Se você já tiver o Inference Operator instalado usando o Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.3 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Add-on Atualização do EKS:
Se você instalou o Inference Operator como um EKS Add-on, atualize para a versão mais recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.4.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Notas de lançamento do Inference: HyperPod Inference Amazon EKS v1.3.0-eksbuild.1 e Inference Operator v3.2
Data de lançamento: 12 de junho de 2026
Resumo
O Inference Operator v3.2 permite que os clientes implantem LLMs de longo contexto (como o Llama 3.3 70B) com latência previsível por token sob carga simultânea. A versão apresenta o Preenchimento e Decodificação Desagregados (DPD), que separa a fase de pré-preenchimento vinculada à computação e a fase de decodificação limitada à largura de banda de memória em pools de GPU distintos e transfere o cache KV entre eles por meio de EFA com RDMA. GPU-Direct O DPD reduz a latência final por token, aumenta a taxa de transferência e permite escalar a capacidade de pré-preenchimento e decodificação de forma independente. Além do DPD, incluímos outras correções de bugs nesta versão.
Características principais
Pré-preenchimento e decodificação desagregados (DPD)
-
Foi adicionado um novo
pdSpeccampo aoInferenceEndpointConfigCRD que permite a inferência desagregada. QuandopdSpecconfigurado, o operador fornece pods separados de pré-preenchimento e decodificador, os conecta por meio do roteador DPD e transfere o cache de KV entre eles usando LMCache sobre NIXL e EFA com RDMA. GPU-Direct Exemplos de campos configuráveis incluem (mais configurações podem ser verificadas no guia do usuário):-
routingThreshold— Token-length limite acima do qual as solicitações usam o caminho desagregado. Abaixo do limite, as solicitações ignoram o pré-preenchedor e vão diretamente para o decodificador. -
prefillSpec.argsedecodingSpec.args— sinalizadores Per-role vLLM mesclados na inicialização.worker.args -
prefillSpec.replicasedecodingSpec.replicas— Dimensione a capacidade de pré-preenchimento e decodificação de forma independente para corresponder à distribuição do comprimento de entrada e saída de sua carga de trabalho.
-
-
Pré-requisito
-
Para implantar endpoints DPD, seus nós de cluster devem oferecer suporte ao EFA com leitura e gravação RDMA e estar localizados na mesma zona de disponibilidade para comunicação de nó a nó com alta largura de banda.
-
Famílias de instâncias recomendadas:
ml.p5.48xlargeml.p5e.48xlarge,ml.p5en.48xlarge,ml.p6-b200.48xlarge,,ml.p6-b300.48xlarge.
-
Correções de bugs
-
Agendamento do operador em nós x86 — A implantação do operador agora é usada
nodeAffinitypara agendar somente nos nós amd64 Linux. -
Incluímos outras correções menores e de segurança.
Atualize para v3.2 ou v1.3.0-eksbuild.1
Atualização do leme:
Se você já tem o Inference Operator instalado via Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Add-on Atualização do EKS:
Se você instalou o Inference Operator como um EKS Add-on, atualize para a versão mais recente:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.3.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
SageMaker HyperPod Notas de lançamento do Inference: HyperPod Inference Amazon EKS v1.2.0-eksbuild.1 e Inference Operator v3.1.2
Data de lançamento: 6 de maio de 2026
Resumo
O Inference Operator v3.1.2 apresenta captura de dados de inferência para registrar tráfego de endpoints, integração de HuggingFace hub para implantação direta de modelos, gerenciamento de DNS do Route 53 para domínios personalizados, implantação local do modelo NVMe para reduzir a latência de inicialização a frio e contas de serviço personalizadas com suporte IRSA.
Novos atributos
-
Captura de dados de inferência — registre entradas e saídas em três pontos de captura: endpoint de SageMaker IA, balanceador de carga (registros de acesso do ALB) e pod de modelo. Habilite qualquer combinação por meio
dataCapturedo seu CRD. Consulte Captura de dados para inferência sobre HyperPod. -
HuggingFace Fonte do modelo — implante modelos diretamente do HuggingFace Hub sem pré-instalação para S3 ou FSx. Suporta modelos fechados via
tokenSecretRef, fixação de revisão e isolamentocommitSHAde token. Compatível com os tempos de execução vLLm, TGI e SGlang. Consulte Implante modelos do Amazon S3, Amazon FSx ou Hugging Face Hub usando kubectl. -
Gerenciamento de DNS do Route 53 — Crie e gerencie automaticamente registros DNS para domínios personalizados via.
dnsConfigConsulte Certificados personalizados e gerenciamento de DNS do Route 53 para HyperPod inferência. -
Implantação do modelo NVMe local — Carregue os pesos do modelo do armazenamento NVMe local do nó para reduzir a latência de inicialização a frio.
modelSourceType: kubernetesVolumeSuporta o fallback para o S3. Consulte Implemente modelos do armazenamento NVMe local usando kubectl. -
Contas de serviço personalizadas — Atribua contas personalizadas ServiceAccounts com suporte IRSA aos pods de inferência via.
spec.kubernetes.serviceAccountName
Correções de bugs
-
Propagação de User-defined tags — as tags ativadas
InferenceEndpointConfigagora se propagam corretamente para oSageMakerEndpointRegistrationCRD e para os recursos de IA posteriores SageMaker . Anteriormente, as tags não eram passadas durante a criação ou as atualizações do registro do endpoint. -
Preservação de réplicas com escalonamento automático — Corrigido um problema em que atualizar um
InferenceEndpointConfigouJumpStartModelCR redefinia a contagem de réplicas para o valor da especificação, substituindo a contagem atual de réplicas. HPA/KEDA-managed O operador agora preserva a contagem ativa de réplicas durante as atualizações de CR. -
Validação de CRD com escalonamento automático — Corrigido um regex de
prometheusTrigger.serverAddressvalidação que exigia incorretamente um segmento de caminho final, causando erros 404 quando o KEDA era anexado ao URL do espaço de trabalho AMP./api/v1/query -
Rotação de certificados — Corrigiu a rotação de certificados personalizados que não se propagava para o ALB após a reinicialização do pod do operador.
Atualize para v3.1.2 ou v1.2.0-eksbuild.1
Atualização do leme:
Se você já tem o Inference Operator instalado via Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1.2 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Add-on Atualização do EKS:
Se você instalou o Inference Operator como um EKS Add-on, atualize para a versão mais recente.
Primeiro, verifique se já hyperpodClusterArn está na configuração do complemento:
CLUSTER=EKS_CLUSTER_NAME REGION=REGION aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text | jq .
Se hyperpodClusterArn estiver presente na saída, execute o seguinte comando para atualizar:
aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --resolve-conflicts OVERWRITE \ --region $REGION
Se não hyperpodClusterArn estiver presente, busque a configuração atual, adicione-a e atualize:
HP_ARN=HYPERPOD_CLUSTER_ARN CURRENT_CONFIG=$(aws eks describe-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --region $REGION \ --query 'addon.configurationValues' --output text) # Add hyperpodClusterArn to the configuration NEW_CONFIG=$(echo "$CURRENT_CONFIG" | jq --arg arn "$HP_ARN" \ '. + {hyperpodClusterArn: $arn}') aws eks update-addon \ --cluster-name $CLUSTER \ --addon-name amazon-sagemaker-hyperpod-inference \ --addon-version v1.2.0-eksbuild.1 \ --configuration-values "$NEW_CONFIG" \ --resolve-conflicts OVERWRITE \ --region $REGION
Aguarde até que o complemento se torne ativo antes de implantar os modelos.
SageMaker HyperPod Notas de lançamento do Inference: Inference Operator v3.1
Data de lançamento: 3 de abril de 2026
Resumo
O Inference Operator v3.1 apresenta a configuração personalizada do pod Kubernetes, o suporte a certificados personalizados e os limites de solicitação por pod.
Características principais
-
Configuração personalizada do pod Kubernetes — Foi adicionado um novo
kubernetescampo aoInferenceEndpointConfigCRD que permite aos usuários personalizar as configurações do pod de inferência:-
Contêineres de inicialização personalizados — Execute contêineres de inicialização definidos pelo usuário antes que o servidor de inferência seja iniciado (por exemplo, aquecimento de cache, configuração de GDS). Os contêineres iniciais são injetados após o contêiner de pré-busca do operador.
-
Volumes personalizados — Adicione volumes adicionais (
emptyDir,,hostPathconfigMap, etc.) à especificação do pod, que podem ser referenciados pelos contêineres de inicialização por meio de.volumeMounts -
Nome do agendador personalizado — especifique um agendador Kubernetes personalizado para posicionamento do pod.
-
-
Certificados personalizados — Use seus próprios certificados ACM para endpoints de inferência em vez de certificados autoassinados gerados pelo operador, configurados via.
customCertificateConfigOferece suporte a certificados ACM publicamente confiáveis, certificados de CA AWS privada e certificados importados de CAs externas. O operador monitora a integridade do certificado e suporta a detecção automática de renovação. -
Limites de solicitação — Controle o tratamento de solicitações por pod por meio da nova
RequestLimitsconfiguração abaixoWorker, com os seguintes campos configuráveis:-
maxConcurrentRequests— Máximo de solicitações simultâneas em voo por pod. -
maxQueueSize— Solicitações para serem colocadas na fila quando o limite de simultaneidade for atingido antes da rejeição. -
overflowStatusCode— Código de status HTTP retornado quando os limites são excedidos (padrão: 429).
-
Para obter informações detalhadas, incluindo pré-requisitos e instruções de upgrade, consulte as seções abaixo.
Pré-requisitos
Para usar o recurso de certificados personalizados, adicione as seguintes permissões à sua função de execução de operador de inferência:
{ "Sid": "ACMCertificateAccess", "Effect": "Allow", "Action": [ "acm:DescribeCertificate", "acm:GetCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*" }
Atualize para a v3.1
Se você já tem o Inference Operator instalado via Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.1 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
SageMaker HyperPod Notas de lançamento do Inference: Inference Operator v3.0
Data de lançamento: 23 de fevereiro de 2026
Resumo
O Inference Operator 3.0 apresenta a Add-on integração EKS para gerenciamento simplificado do ciclo de vida, suporte ao Node Affinity para controle granular de agendamento e melhor marcação de recursos. Helm-based As instalações existentes podem ser migradas para o EKS Add-on usando o script de migração fornecido. Atualize sua função de execução do Inference Operator com novas permissões de marcação antes da atualização.
Características principais
-
Add-on Integração EKS — gerenciamento Enterprise-grade do ciclo de vida com experiência de instalação simplificada
-
Node Affinity — Controle granular de agendamento para excluir instâncias spot, preferir zonas de disponibilidade ou segmentar nós com rótulos personalizados
Para obter informações detalhadas, incluindo pré-requisitos, instruções de upgrade e diretrizes de migração, consulte as seções abaixo.
Pré-requisitos
Antes de atualizar a versão do Helm para 3.0, os clientes devem adicionar mais permissões de marcação à sua função de execução de operador de inferência. Como parte da melhoria da marcação e da segurança de recursos, o Inference Operator agora identifica os recursos ALB, S3 e ACM. Esse aprimoramento requer permissões adicionais na função de execução do Operador de Inferência. Adicione as seguintes permissões à sua função de execução de operador de inferência:
{ "Sid": "CertificateTagginPermission", "Effect": "Allow", "Action": [ "acm:AddTagsToCertificate" ], "Resource": "arn:aws:acm:*:*:certificate/*", }, { "Sid": "S3PutObjectTaggingAccess", "Effect": "Allow", "Action": [ "s3:PutObjectTagging" ], "Resource": [ "arn:aws:s3:::<TLS_BUCKET>/*" # Replace * with your TLS bucket ] }
Atualize para a v3.0
Se você já tem o Inference Operator instalado via Helm, use os seguintes comandos para fazer o upgrade:
helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm upgrade hyperpod-inference-operator . -n kube-system \ -f current-values.yaml --set image.tag=v3.0 # Verification kubectl get deployment hyperpod-inference-operator-controller-manager \ -n hyperpod-inference-system \ -o jsonpath='{.spec.template.spec.containers[0].image}'
Migração do Helm para o EKS Add-on
Se o Inference Operator for instalado por meio do Helm antes da versão 3.0, recomendamos migrar para o EKS Add-on para obter atualizações oportunas sobre os novos recursos que serão lançados para o Inference Operator. Esse script migra o operador de SageMaker HyperPod inferência da Helm-based instalação para a instalação do EKS Add-on .
Visão geral: o script usa o nome e a região do cluster como parâmetros, recupera a configuração de instalação existente do Helm e migra para a implantação do EKS. Add-on Ele cria novas funções do IAM para o operador de inferência, o controlador ALB e o operador KEDA.
Antes de migrar o operador de inferência, o script garante que as dependências necessárias (driver S3 CSI, driver FSx CSI, cert-manager e metrics-server) existam. Se eles não existirem, ele os implanta como Add-on.
Após a conclusão da Add-on migração do Inference Operator, o script também migra o S3, o FSx e outras dependências (ALB, KEDA, cert-manager, metrics-server) se elas tiverem sido originalmente instaladas por meio do gráfico Inference Operator Helm. Use --skip-dependencies-migration para pular esta etapa para o driver S3 CSI, o driver FSx CSI, o cert-manager e o metrics-server. Observe que o ALB e o KEDA são instalados como parte do Add-on mesmo namespace do Inference Operator e serão migrados como parte do Inference Operator. Add-on
Importante
Durante a migração, não implante novos modelos, pois eles não serão implantados até que a migração seja concluída. Quando o operador de inferência Add-on estiver no estado ATIVO, novos modelos poderão ser implantados. O tempo de migração normalmente leva de 15 a 20 minutos e pode ser concluído em 30 minutos se apenas alguns modelos estiverem implantados atualmente.
Pré-requisitos de migração:
AWS CLI configurado com as credenciais apropriadas
kubectl configurado com acesso ao seu cluster EKS
Helm instalado
Instalação existente do Helm do operador de inferência de hiperpodes
nota
Os endpoints que já estão em execução não serão interrompidos durante o processo de migração. Os endpoints existentes continuarão atendendo ao tráfego sem interrupções durante a migração.
Obtendo o script de migração:
git clone https://github.com/aws/sagemaker-hyperpod-cli.git cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator/migration
Uso:
./helm_to_addon.sh [OPTIONS] \ --cluster-name <cluster-name> (Required) \ --region <region> (Required) \ --helm-namespace kube-system (Optional) \ --auto-approve (Optional) \ --skip-dependencies-migration (Optional) \ --s3-mountpoint-role-arn <s3-mountpoint-role-arn> (Optional) \ --fsx-role-arn <fsx-role-arn> (Optional)
Opções:
--cluster-name NAME— Nome do cluster EKS (obrigatório)--region REGION— AWS região (obrigatório)--helm-namespace NAMESPACE— Namespace onde o Helm chart está instalado (padrão: kube-system) (opcional)--s3-mountpoint-role-arn ARN— Função IAM do driver CSI do S3 Mountpoint (opcional)--fsx-role-arn ARN— Função IAM do driver FSx CSI ARN (opcional)--auto-approve— Ignore as solicitações de confirmação se esse sinalizador estiver ativado.step-by-stepeauto-approvesão mutuamente exclusivos, se--auto-approvefor fornecido, não especifique--step-by-step(opcional)--step-by-step— Faça uma pausa após cada etapa principal para revisão. Isso não deve ser mencionado--auto-approvese já tiver sido adicionado (opcional)--skip-dependencies-migration— Ignore a migração de Helm-installed dependências para. Add-on Pois as dependências NÃO foram instaladas por meio do gráfico Inference Operator Helm, ou se você quiser gerenciá-las separadamente. (opcional)
Exemplos:
Migração básica (migra dependências):
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1
Auto-approve sem avisos:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --auto-approve
Ignore a migração de dependências para FSx, S3 mountpoint, cert manager e Metrics Server:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --skip-dependencies-migration
Forneça as funções existentes do S3 e do FSx IAM:
./helm_to_addon.sh \ --cluster-name my-cluster \ --region us-east-1 \ --s3-mountpoint-role-arn arn:aws:iam::123456789012:role/s3-csi-role \ --fsx-role-arn arn:aws:iam::123456789012:role/fsx-csi-role
Local do backup:
Os backups são armazenados em /tmp/hyperpod-migration-backup-<timestamp>/
Os backups permitem migração e recuperação seguras:
Reversão em caso de falha — Se a migração falhar, o script poderá restaurar automaticamente o cluster ao estado anterior à migração usando as configurações de backup
Trilha de auditoria — fornece um registro completo do que existia antes da migração para solução de problemas e conformidade
Referência de configuração — permite comparar as configurações pré-migração e pós-migração
Recuperação manual — se necessário, você pode inspecionar e restaurar manualmente recursos específicos do diretório de backup
Reversão:
Se a migração falhar, o script solicitará a confirmação do usuário antes de iniciar a reversão para restaurar o estado anterior.
SageMaker HyperPod Notas de lançamento do Inference: Inference Operator v2.3
O que há de novo
Esta versão introduz novos campos opcionais nas Definições de Recursos Personalizados (CRDs) para aprimorar a flexibilidade da configuração de implantação.
Recursos
-
Tipos de várias instâncias
-
Confiabilidade de implantação aprimorada — Suporta configurações do tipo de várias instâncias com failover automático para tipos de instância alternativos quando as opções preferidas não têm capacidade
-
Agendamento inteligente de recursos — usa a afinidade de nós do Kubernetes para priorizar os tipos de instância e, ao mesmo tempo, garantir a implantação mesmo quando os recursos preferenciais não estão disponíveis
-
Custo e desempenho otimizados — mantém suas preferências de tipo de instância e evita falhas relacionadas à capacidade durante as flutuações do cluster
-
Correções de bugs
As alterações no campo invocationEndpoint na especificação do agora InferenceEndpointConfig entrarão em vigor:
-
Se o
invocationEndpointcampo for corrigido ou atualizado, os recursos dependentes, como oIngress, o Load Balancer e o SageMaker EndpointSageMakerEndpointRegistration, serão atualizados com a normalização. -
O valor
invocationEndpointfornecido será armazenado como está na própriaInferenceEndpointConfigespecificação. Quando esse valor for usado para criar um balanceador de carga e, se ativado, um SageMaker endpoint, ele será normalizado para ter uma barra inicial.-
v1/chat/completionsserá normalizado/v1/chat/completionspara o AWS Load BalancerIngresse o Endpoint. SageMaker Para oSageMakerEndpointRegistration, ele será exibido em suas especificações comov1/chat/completions. -
///invokeserá normalizado/invokepara o AWS Load BalancerIngresse o Endpoint. SageMaker Para oSageMakerEndpointRegistration, ele será exibido em suas especificações comoinvoke.
-
Instalando o Helm:
Siga: https://github.com/aws/sagemaker-hyperpod-cli/tree/main/helm_chart
Se você estiver focado em instalar apenas o operador de inferência, após a etapa 1, ou sejaSet Up Your Helm Environment, façacd HyperPodHelmChart/charts/inference-operator. Como você está no próprio diretório do gráfico do operador de inferência, nos comandos, onde quer que você vejahelm_chart/HyperPodHelmChart, . substitua por.
Atualize o Operator para v2.3 caso já esteja instalado:
cd sagemaker-hyperpod-cli/helm_chart/HyperPodHelmChart/\ charts/inference-operator helm get values -n kube-system hyperpod-inference-operator \ > current-values.yaml helm upgrade hyperpod-inference-operator . \ -n kube-system \ -f current-values.yaml \ --set image.tag=v2.3