View a markdown version of this page

SageMaker HyperPod Eventos do Slurm Cluster - SageMaker IA da Amazon

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

SageMaker HyperPod Eventos do Slurm Cluster

A Amazon SageMaker HyperPod emite eventos de cluster estruturados que fornecem visibilidade das mudanças operacionais no nível do cluster, do grupo de instâncias e da instância. Você pode usar esses eventos para monitorar a atividade de provisionamento, rastrear operações de escalabilidade, detectar falhas e criar canais de alerta automatizados.

Os eventos de cluster estão disponíveis para clusters HyperPod Slurm com NodeProvisioningMode definido como. Continuous Os eventos podem ser acessados por meio das DescribeClusterEvent APIs ListClusterEvents e, do console de SageMaker IA e da Amazon EventBridge.

Para obter o esquema completo do evento, os níveis de gravidade, o catálogo completo de eventos e os detalhes da EventBridge integração, consulteSageMaker HyperPod referência de eventos de cluster.

Pré-requisitos

  • Seu cluster HyperPod Slurm deve ter sido NodeProvisioningMode definido como. Continuous Os clusters que usam o modo de provisionamento legado não emitem eventos estruturados.

  • Para usar a API, você precisa sagemaker:ListClusterEvents de sagemaker:DescribeClusterEvent permissões na sua política do IAM.

Tipos de eventos

HyperPod emite duas categorias de eventos para clusters Slurm em provisionamento contínuo: eventos comuns que se aplicam a todos os orquestradores e eventos. Slurm-specific

Os eventos comuns abrangem as principais operações de infraestrutura, como provisionamento e encerramento de instâncias, escalabilidade de grupos de instâncias, tratamento de reservas de capacidade, execução de scripts de ciclo de vida, gerenciamento de ENI, ciclo de vida do sistema de arquivos FSx e fluxos de trabalho de correção. Para ver a lista completa, consulte Eventos comuns (EKS e Slurm) na referência de eventos de HyperPod cluster.

Slurm-specific os eventos abrangem operações específicas do orquestrador, como validação de parâmetros de provisionamento, criação de chaves munge, detecção de desvio de configuração do Slurm, reconfiguração do Slurm e reversão do cluster. Esses eventos fornecem visibilidade dos estágios Slurm-specific do ciclo de vida que antes só eram observáveis por meio de registros. CloudWatch Para ver a lista completa, consulte Slurm-specific eventos na referência de eventos de HyperPod cluster.

Visualizando eventos no console

  1. Abra o console de SageMaker IA.

  2. No painel de navegação esquerdo, escolha HyperPod clusters.

  3. Escolha o nome do seu cluster.

  4. Escolha a guia Eventos.

A guia Eventos exibe uma lista paginada de eventos com colunas para nível do evento, ID do evento, nome do recurso, tipo de recurso, descrição e horário do evento. Você pode filtrar eventos por atributo usando a caixa de pesquisa, classificar por horário do evento e escolher um ID de evento para ver todos os detalhes do evento, incluindo os metadados do evento e o registro completo do evento.

Listando eventos usando o AWS CLI

Use o list-cluster-events comando para recuperar eventos para seu cluster:

aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20

Você pode restringir os resultados usando os seguintes filtros:

  • --resource-type— filtrar por ClusterInstanceGroup, ouInstance.

  • --instance-group-name— filtrar eventos para um grupo de instâncias específico.

  • --node-id— filtrar eventos para uma instância específica do EC2.

  • --event-time-aftere --event-time-before — filtrar para uma janela de tempo específica.

Por exemplo, para ver somente eventos em nível de grupo de instâncias para um grupo de instâncias específico:

aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers

Descrevendo um evento específico

Use o describe-cluster-event comando com um ID de evento da saída da lista para recuperar todos os detalhes do evento, incluindoEventLevel,Description, eEventMetadata:

aws sagemaker describe-cluster-event \ --cluster-name my-slurm-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205

Para ver a estrutura do registro de eventos retornado e uma descrição de cada campo, consulte Registro de eventos de cluster na referência de eventos do HyperPod cluster.

Automatizando respostas com a Amazon EventBridge

HyperPod os eventos de cluster são enviados automaticamente para a Amazon EventBridge sob o tipo de detalheSageMaker HyperPod Cluster Event, permitindo que você encaminhe eventos para destinos como Lambda, Amazon SNS, Step Functions ou Amazon SQS. Você pode filtrar no EventLevel campo para acionar alertas somente para Error eventos ou filtrar por ARN do cluster para definir o escopo das regras para um cluster específico.

Para padrões de EventBridge eventos, exemplos de carga útil e os tipos relacionados SageMaker HyperPod Cluster State Change e SageMaker HyperPod Cluster Node Health Event detalhados, consulte EventBridge integração na referência de eventos do HyperPod cluster.