

本文属于机器翻译版本。若本译文内容与英语原文存在差异，则一律以英文原文为准。

# SageMaker HyperPod Slurm 集群事件
<a name="sagemaker-hyperpod-cluster-events-slurm-page"></a>

Amazon 会 SageMaker HyperPod 发出结构化集群事件，让人们能够了解集群、实例组和实例级别的操作变化。您可以使用这些事件来监控配置活动、跟踪扩展操作、检测故障和构建自动警报管道。

集群事件适用于`NodeProvisioningMode`设置为的 HyperPod Slurm 集群。`Continuous`事件可通过`ListClusterEvents`和 `DescribeClusterEvent` API、 SageMaker AI 控制台和 Amazon 进行访问 EventBridge。

有关完整的事件架构、严重性级别、完整的事件目录和 EventBridge集成的详细信息，请参阅[SageMaker HyperPod 集群事件参考](sagemaker-hyperpod-cluster-events-reference.md)。

## 先决条件
<a name="sagemaker-hyperpod-cluster-events-slurm-prereqs"></a>
+ 你的 HyperPod Slurm 集群必须已`NodeProvisioningMode`设置为。`Continuous`使用传统配置模式的集群不会发出结构化事件。
+ 要使用 API，您需要在您的 IAM 策略中`sagemaker:DescribeClusterEvent`拥有`sagemaker:ListClusterEvents`和权限。

## 事件类型
<a name="sagemaker-hyperpod-cluster-events-slurm-types"></a>

HyperPod 在持续配置时为 Slurm 集群发出两类事件：适用于所有协调器的常见事件和事件。 Slurm-specific

**常见事件**包括核心基础设施操作，例如实例配置和终止、实例组扩展、容量预留处理、生命周期脚本执行、ENI 管理、FSx 文件系统生命周期和修补工作流程。有关完整列表，请参阅 HyperPod 集群事件参考[常见事件（EKS 和 Slurm）](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-common)中的。

**Slurm-specific 事件**涵盖特定于编排器的操作，例如配置参数验证、munge 密钥创建、Slurm 配置偏差检测、Slurm 重新配置和集群回滚。这些事件提供了对 Slurm-specific 生命周期阶段的可见性，而这些阶段以前只能通过 CloudWatch 日志进行观察。有关完整列表，请参阅 HyperPod 集群事件参考[Slurm-specific 事件](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-slurm)中的。

## 在控制台中查看事件
<a name="sagemaker-hyperpod-cluster-events-slurm-console"></a>

1. 打开 A [SageMaker I 控制台](https://console.aws.amazon.com/sagemaker)。

1. 在左侧导航窗格中，选择**HyperPod集群**。

1. 选择您的集群名称。

1. 选择**事件**选项卡。

“**事件**” 选项卡显示分页的事件列表，其中包含事件级别、事件 ID、资源名称、资源类型、描述和事件时间列。您可以使用搜索框按属性筛选事件，按事件时间排序，然后选择事件 ID 以查看完整的事件详细信息，包括事件元数据和完整的事件记录。

## 使用列出事件 AWS CLI
<a name="sagemaker-hyperpod-cluster-events-slurm-cli"></a>

使用`list-cluster-events`命令检索集群的事件：

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --sort-by EventTime \
    --sort-order Descending \
    --max-results 20
```

您可以使用以下筛选器缩小结果范围：
+ `--resource-type`— 按`Cluster``InstanceGroup`、或筛选`Instance`。
+ `--instance-group-name`— 筛选特定实例组的事件。
+ `--node-id`— 筛选到特定 EC2 实例的事件。
+ `--event-time-after`和 `--event-time-before` — 筛选到特定的时间窗口。

例如，要仅查看特定实例组的实例组级别事件，请执行以下操作：

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --resource-type InstanceGroup \
    --instance-group-name gpu-workers
```

## 描述特定事件
<a name="sagemaker-hyperpod-cluster-events-slurm-describe"></a>

使用带有列表输出中事件 ID 的`describe-cluster-event`命令来检索完整的事件详细信息`EventLevel`，包括`Description`、和`EventMetadata`：

```
aws sagemaker describe-cluster-event \
    --cluster-name my-slurm-cluster \
    --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
```

有关返回的事件记录的结构和每个字段的描述，请参阅 HyperPod 集群事件参考[集群事件记录](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-record)中的。

## 使用 Amazon 自动回复 EventBridge
<a name="sagemaker-hyperpod-cluster-events-slurm-eventbridge"></a>

HyperPod 集群事件会以详细信息类型自动发送到亚马逊 EventBridge `SageMaker HyperPod Cluster Event`，使您能够将事件路由到目标，例如 Lambda、Amazon SNS、Step Functions 或 Amazon SQS。您可以对该`EventLevel`字段进行筛选以仅触发`Error`事件警报，也可以按集群 ARN 进行筛选，将规则范围限定为特定集群。

有关 EventBridge 事件模式、有效负载示例以及相关类型`SageMaker HyperPod Cluster State Change`和`SageMaker HyperPod Cluster Node Health Event`详细信息类型，请参阅 HyperPod 集群事件参考[EventBridge 整合](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-eventbridge)中的。

## 相关主题
<a name="sagemaker-hyperpod-cluster-events-slurm-related"></a>
+ [SageMaker HyperPod 集群事件参考](sagemaker-hyperpod-cluster-events-reference.md)
+ [亚马逊 A SageMaker I 发送给亚马逊的事件 EventBridge](https://docs.aws.amazon.com/sagemaker/latest/dg/automating-sagemaker-with-eventbridge.html)