View a markdown version of this page

Reserve planos de treinamento flexíveis para cargas de trabalho de ML - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Reserve planos de treinamento flexíveis para cargas de trabalho de ML

Os planos SageMaker de treinamento da Amazon são um recurso que permite reservar e ajudar a maximizar o uso da capacidade da GPU para cargas de trabalho de ML. Esse recurso fornece acesso a tipos de instância altamente procurados que abrangem uma variedade de opções de GPU-accelerated computação, incluindo as mais recentes tecnologias de GPU NVIDIA e chips Trainium. AWS Com planos de SageMaker treinamento, você pode garantir acesso previsível a esses recursos computacionais de alta demanda e alto desempenho dentro de seus prazos e orçamentos especificados, sem a necessidade de gerenciar a infraestrutura subjacente. Essa flexibilidade é particularmente valiosa para organizações que lidam com os desafios de adquirir e programar essas instâncias de computação tão procuradas para workloads essenciais de IA.

O que são planos SageMaker de treinamento

SageMaker os planos de treinamento permitem que você reserve capacidade computacional adaptada às suas necessidades de recursos alvo, como trabalhos de SageMaker treinamento, SageMaker HyperPod clusters, endpoints de SageMaker inferência ou aplicativos do Studio. SageMaker O serviço gerencia automaticamente a reserva, o provisionamento de recursos de computação acelerada, a configuração da infraestrutura, a execução de workloads e a recuperação de falhas na infraestrutura.

SageMaker os planos de treinamento consistem em um ou mais blocos de capacidade reservada, cada um definido pelos seguintes parâmetros:

  • Tipo de instância específico

  • Quantidade de instâncias

  • Zona de disponibilidade

  • Duração

  • Horário de início e término

nota
  • Os planos de treinamento são específicos para o recurso de destino (SageMaker Training Job SageMaker HyperPod, endpoints de SageMaker inferência ou aplicativos do SageMaker Studio) e não podem ser trocados.

  • Vários blocos de capacidade reservada em um único plano de treinamento podem ser descontínuos. Isso significa que pode haver lacunas entre os blocos de capacidade reservada.

Benefícios dos planos SageMaker de treinamento

SageMaker os planos de treinamento oferecem os seguintes benefícios:

  • Acesso previsível: reserve a capacidade de GPU para workloads de machine learning dentro de prazos especificados.

  • Gerenciamento de custos: planeje e faça um orçamento para seus requisitos de carga de trabalho de ML com antecedência.

  • Gerenciamento automatizado de recursos: os planos de SageMaker treinamento lidam com o provisionamento e o gerenciamento da infraestrutura.

  • Flexibilidade: crie planos de treinamento para vários recursos, incluindo trabalhos de SageMaker treinamento, SageMaker HyperPod clusters, endpoints de SageMaker inferência e aplicativos do SageMaker Studio.

  • Tolerância a falhas: beneficie-se da recuperação automática de falhas de infraestrutura e da migração da carga de trabalho entre as zonas de disponibilidade para trabalhos SageMaker de treinamento.

SageMaker planos de treinamento, reserva antecipada e horários de início flexíveis

SageMaker os planos de treinamento permitem que você reserve a capacidade computacional com antecedência, com horários de início e durações flexíveis.

  • Reserva antecipada: você pode reservar um plano de treinamento até 8 semanas (56 dias) antes da data de início.

  • Prazo mínimo de entrega: as ofertas de planos de SageMaker treinamento podem estar disponíveis para começar dentro de 30 minutos após a reserva, sujeitas à disponibilidade.

    nota

    Você pode pesquisar e comprar um plano que estará acessível em 30 minutos. Para garantir a ativação oportuna, a transação de pagamento deve ser concluída com êxito pelo menos 5 minutos antes do horário de início desejado. Por exemplo, se quiser que um plano comece às 14h, você pode fazer uma pesquisa de última hora até 13h30 e concluir sua compra até 13h55 para garantir que o plano esteja pronto até as 14h.

  • Duração da reserva e quantidade de instâncias: os planos de SageMaker treinamento permitem que você reserve instâncias com opções específicas de duração e quantidade. Para ver os tipos de instância disponíveis em determinadas Região da AWS opções de duração e quantidade, consulteTipos de instância compatíveis, Regiões da AWS e preços.

  • Hora de término: os planos de treinamento sempre terminam às 11h30 UTC do último dia da reserva.

  • Encerramento do plano de treinamento: se você estiver usando trabalhos de treinamento, endpoints de inferência e aplicativos do Studio como um recurso de destino e 30 minutos permanecerem em uma capacidade reservada, os planos de SageMaker treinamento iniciarão o processo de encerrar todas as instâncias em execução dentro desse bloco até que a próxima capacidade reservada se torne ativa. Você mantém acesso total ao seu plano de treinamento até 30 minutos antes do horário final do bloco de capacidade reservada.

    Se o recurso de destino for um SageMaker HyperPod cluster, esse limite de tempo será de uma hora.

Tipos de instância compatíveis, Regiões da AWS e preços

Os planos de treinamento permitem o uso de reservas para os seguintes tipos específicos de instância de alto desempenho, cada um disponível em Regiões da AWS selecionadas:

  • ml.p4d.24xlarge

  • ml.p5.4xlarge

  • ml.p5.48xlarge

  • ml.p5e.48xlarge

  • ml.p5en.48xlarge

  • ml.trn1.32xlarge

  • ml.trn2.48xlarge

  • ml.p6-b200.48xlarge

  • ml.p6-b300,48x grande

  • ml.g6.xlarge (entre em contato com seu gerente de contas)

  • ml.g6.4xlarge (entre em contato com seu gerente de contas)

UltraServers(No momento, não pode ser comprado de forma autossuficiente; entre em contato com seu gerente de contas.)

  • ml.p6e-gb200.36xlarge

  • ml.p6e-gb200.72xlarge

nota

A disponibilidade dos tipos de instância pode ser alterada ao longo do tempo. Para obter as informações mais atualizadas sobre os tipos de instância disponíveis de acordo com a região, bem como seus respectivos preços, consulte SageMaker Preços. Role para baixo até a seção de planos de treinamento SageMaker HyperPod flexíveis da Amazon em On-Demand Preços. Selecione uma região para ver a lista de tipos de instância disponíveis.

A disponibilidade em várias regiões permite escolher o local mais adequado para workloads, considerando fatores como requisitos de residência de dados e proximidade de outros serviços da AWS .

Importante
  • Você pode usar planos SageMaker de treinamento para reservar instâncias com as seguintes opções de duração e quantidade de instâncias.

    • As durações das reservas estão disponíveis em incrementos de 1 dia, de 1 a 182 dias.

    • As opções de quantidade de instâncias de reserva são 1, 2, 4, 8, 16, 32 ou 64 instâncias.

  • Certifique-se de que seus trabalhos de treinamento ou cotas de HyperPod serviço permitam um número máximo de instâncias por tipo de instância que exceda o número de instâncias especificado em seu plano. Para visualizar suas cotas atuais ou solicitar um aumento de cota, consulte Veja as cotas dos planos de SageMaker treinamento usando o AWS console de gerenciamento.

UltraServers em SageMaker IA

UltraServers na SageMaker IA, ofereça um conjunto de instâncias interconectadas por meio de um domínio de rede de alta largura de banda. Por exemplo, o P6e-GB200 UltraServer conecta até 18 p6e-gb200.36xlarge instâncias em um domínio NVIDIA NVLink. Com 4 GPUs NVIDIA Blackwell por instância, cada uma P6e-GB200 UltraServer suporta 72 GPUs, para que você possa executar suas maiores cargas de trabalho de IA com alto desempenho em IA. SageMaker

Ao usar UltraServers a SageMaker IA, você obtém desempenho combinado com a infraestrutura gerenciada da SageMaker IA, recursos integrados de resiliência a falhas, recursos de monitoramento integrados e integração nativa com outros AWS serviços e SageMaker inteligência artificial. Essa integração permite que você se concentre no desenvolvimento e na implantação do modelo, enquanto a SageMaker IA lida com o trabalho pesado indiferenciado de gerenciar a infraestrutura de IA.

nota

UltraServers estão disponíveis somente na Zona Local de Dallas (us-east-1-dfw-2a), que é uma extensão da região Leste dos EUA (Norte da Virgínia). Para obter mais informações, consulte Começando com Zona local da AWS s

Considerações

Considere o seguinte ao usar UltraServers com SageMaker IA:

  • Você pode usar tanto UltraServers para trabalhos de treinamento SageMaker HyperPod quanto para trabalhos SageMaker de treinamento.

  • Você só pode comprar UltraServers em unidades completas. Para obter mais informações sobre instâncias e preços, consulte os planos SageMaker HyperPod flexíveis de treinamento da Amazon nos preços da Amazon SageMaker AI.

  • Se você estiver usando UltraServers com HyperPod, adiciona HyperPod automaticamente rótulos de topologia aos seus recursos para ajudá-lo na alocação de recursos. Para obter mais informações, consulte Usando agendamento com reconhecimento de topologia na Amazon. SageMaker HyperPod

  • SageMaker A IA UltraServers oferece vários recursos que aprimoram a resiliência de suas cargas de trabalho, incluindo verificações preventivas e detecção e mitigação automáticas de falhas. Dependendo do problema, a SageMaker IA pode executar ações para recuperar suas cargas de trabalho, como reiniciar instâncias, substituir instâncias com falha por peças sobressalentes e substituir instâncias com falha. UltraServers

  • Para maior resiliência, você pode configurar instâncias dentro de um UltraServer para serem usadas como peças de reposição. Manter uma instância sobressalente dentro do UltraServer garante que a SageMaker IA possa responder rapidamente a uma falha de instância e, ao mesmo tempo, minimizar qualquer impacto em seus trabalhos. Recomendamos que você mantenha uma instância sobressalente por UltraServer. Não é necessário reservar nenhuma instância sobressalente, mas isso pode prejudicar as opções de suporte e retardar a recuperação de falhas. Você compra UltraServers por inteiro, portanto, o número de peças de reposição que você reserva não afeta os preços.

  • Para ver o status e as instâncias em um UltraServer, use a operação da ListTrainingPlans API ou o AWS console para ver os planos de treinamento. Usando essas ferramentas, você pode ver o número total de instâncias disponíveis, instâncias atualmente em uso, instâncias não íntegras, o número de peças de reposição configuradas e outras informações. Os status possíveis são ok, impaired e insufficient-data.

SageMaker comportamento de busca de planos de treinamento

Ao pesquisar uma oferta de plano de treinamento, os planos de SageMaker treinamento usam a seguinte abordagem para maximizar a disponibilidade e a flexibilidade de recursos para os usuários, mesmo quando a demanda é alta e os blocos de capacidade reservada são escassos:

  • Pesquisa contínua inicial: os planos de SageMaker treinamento primeiro tentam encontrar um bloco único e contínuo de capacidade reservada que corresponda à duração especificada nas datas de início e término, ao mesmo tempo em que atendem a todos os outros critérios especificados, incluindo recurso alvo, tipo de instância solicitada e número de instâncias.

  • Two-block pesquisa: os planos de SageMaker treinamento não retornam um resultado “sem capacidade” se um único bloco contínuo de capacidade reservada que atenda a todos os critérios não estiver disponível. Em vez disso, ele tenta atender automaticamente à solicitação usando dois blocos de capacidade reservada separados, dividindo a duração total em dois segmentos de tempo.

    Essa abordagem de dois blocos fornece maior flexibilidade na alocação de recursos, possivelmente protegendo instâncias de alta demanda que, de outra forma, não estariam disponíveis.

nota

SageMaker os planos de treinamento retornam até três ofertas de um ou dois segmentos. Por exemplo, para um plano de 48 horas de duração, os planos de SageMaker treinamento podem oferecer um plano com dois blocos de 24 horas, um bloco contínuo de 48 horas e dois blocos com duração desigual.

Considerações

Importante
  • As compras do plano de treinamento são definitivas e não podem ser canceladas.

  • Os planos de treinamento não podem ser modificados para adicionar ou remover instâncias; eles só podem ser estendidos para uma nova data de término.

  • Os planos de treinamento não podem ser compartilhados entre AWS contas ou dentro AWS da sua organização.

  • Ao pesquisar ofertas de planos de treinamento, os planos de SageMaker treinamento adaptam sua estratégia de busca com base em: target resources

    Para SageMaker HyperPod clusters:

    • As ofertas são limitadas a uma única zona de disponibilidade (AZ).

    • Isso garante desempenho de rede consistente e localidade de dados dentro do cluster.

    Para trabalhos SageMaker de treinamento:

    • As ofertas podem abranger várias zonas de disponibilidade.

    • Isso é particularmente relevante quando a oferta do plano contém várias capacidades reservadas descontínuas.

    • Por exemplo, um plano pode incluir capacidade AZ-A para um bloco de capacidade reservada e AZ-B para outro. SageMaker os planos de treinamento podem mover automaticamente as cargas de trabalho entre as zonas de disponibilidade (AZs) com base na disponibilidade de recursos.

      Essa abordagem multi-AZ para tarefas de treinamento oferece maior flexibilidade na alocação de recursos, aumentando as chances de encontrar a capacidade adequada para sua workload. No entanto, você deve estar ciente de que seus trabalhos podem ser executados em diferentes AZs durante diferentes partes do período de reserva.

  • Ao receber uma oferta de dois blocos, os usuários devem considerar cuidadosamente se essa alocação dividida atende aos requisitos de workload. Para se adaptar à natureza não contínua da reserva, pode ser necessário ajustar o agendamento do trabalho ou da distribuição da workload.

SageMaker planos de treinamento, fluxo de trabalho do usuário

SageMaker os planos de treinamento funcionam através das seguintes etapas:

Etapas de administração:

  1. Pesquisar e analisar: encontre ofertas de planos disponíveis que atendam aos seus requisitos de computação, como tipo, contagem, horário de início e duração da instância.

  2. Criar um plano: reserve um plano de treinamento que atenda às suas necessidades usando o ID da oferta de plano escolhida.

  3. Pagamento e agendamento: após o pagamento antecipado bem-sucedido, o status do plano passa a ser Scheduled.

Etapas para engenheiros de ML/usuários do plano:

  1. Alocação de recursos: use seu plano para alocar tarefas de treinamento de SageMaker IA, grupos de instâncias de SageMaker HyperPod cluster, endpoints de SageMaker inferência ou espaços nos aplicativos do Studio. SageMaker

  2. Ativação: quando a data de início do plano chega, ela se torna Active. Com base na capacidade reservada disponível, os planos de SageMaker treinamento provisionam automaticamente tarefas de treinamento, grupos de instâncias, endpoints de inferência ou aplicativos do Studio.

nota

O status do plano de treinamento muda de Scheduled para Active quando um período de capacidade reservada começa e depois volta para Scheduled enquanto se espera o início do próximo período de capacidade reservada.

Os diagramas a seguir fornecem uma visão geral abrangente de como os planos de SageMaker treinamento interagem com os diferentestarget resources, ilustrando o ciclo de vida de um plano e seu papel na alocação de recursos para trabalhos de treinamento e SageMaker clusters. SageMaker HyperPod

  • Planos de SageMaker treinamento para o trabalho de treinamento: o primeiro diagrama ilustra o fluxo de trabalho de ponta a ponta da interação entre um plano de treinamento e SageMaker um trabalho de treinamento.

    Cobrança, reserva de capacidade com planos de treinamento e emprego SageMaker de treinamento. Ilustração do ciclo de vida do plano de treinamento e dos estados de tarefas de treinamento gerenciadas por administradores e engenheiros de ML.
  • Planos de treinamento para SageMaker HyperPod clusters: o segundo diagrama ilustra o fluxo de trabalho completo da interação entre um plano de treinamento e um SageMaker HyperPod grupo de instâncias.

    Faturamento, reserva de capacidade com planos de treinamento e fluxo de trabalho de gerenciamento de grupos de instâncias. Ilustração de administradores e engenheiros de ML do ciclo de vida do plano de treinamento e dos estados do grupo de instâncias.