

本文為英文版的機器翻譯版本，如內容有任何歧義或不一致之處，概以英文版為準。

# SageMaker HyperPod Slurm 叢集事件
<a name="sagemaker-hyperpod-cluster-events-slurm-page"></a>

Amazon SageMaker HyperPod 會發出結構化叢集事件，提供叢集、執行個體群組和執行個體層級的操作變更可見性。您可以使用這些事件來監控佈建活動、追蹤擴展操作、偵測失敗，以及建置自動化提醒管道。

叢集事件適用於`NodeProvisioningMode`將 設為 的 HyperPod Slurm 叢集`Continuous`。事件可透過 `ListClusterEvents`和 `DescribeClusterEvent` APIs、SageMaker AI 主控台和 Amazon EventBridge 存取。

如需完整的事件結構描述、嚴重性等級、完整事件目錄和 EventBridge 整合詳細資訊，請參閱 [SageMaker HyperPod 叢集事件參考](sagemaker-hyperpod-cluster-events-reference.md)。

## 先決條件
<a name="sagemaker-hyperpod-cluster-events-slurm-prereqs"></a>
+ 您的 HyperPod Slurm 叢集必須將 `NodeProvisioningMode`設定為 `Continuous`。使用舊版佈建模式的叢集不會發出結構化事件。
+ 若要使用 API，您需要 IAM 政策中的 `sagemaker:ListClusterEvents`和 `sagemaker:DescribeClusterEvent`許可。

## Event types (事件類型)
<a name="sagemaker-hyperpod-cluster-events-slurm-types"></a>

HyperPod 會在連續佈建時為 Slurm 叢集發出兩類事件：適用於所有協調器的常見事件，以及 Slurm 特定事件。

**常見事件**涵蓋核心基礎設施操作，例如執行個體佈建和終止、執行個體群組擴展、容量保留處理、生命週期指令碼執行、ENI 管理、FSx 檔案系統生命週期和修補工作流程。如需完整清單，請參閱 HyperPod 叢集事件參考[常見事件 (EKS 和 Slurm)](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-common)中的 。

**Slurm 特定事件**涵蓋協調器特定操作，例如佈建參數驗證、建立 munge 金鑰、Slurm 組態偏離偵測、Slurm 重新設定和叢集復原。這些事件可讓您查看先前只能透過 CloudWatch 日誌觀察到的 Slurm 特定生命週期階段。如需完整清單，請參閱 HyperPod 叢集事件參考[Slurm 特定事件](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-slurm)中的 。

## 在主控台中檢視事件
<a name="sagemaker-hyperpod-cluster-events-slurm-console"></a>

1. 開啟 [SageMaker AI 主控台](https://console.aws.amazon.com/sagemaker)。

1. 在左側導覽窗格中，選擇 **HyperPod 叢集**。

1. 選擇您的叢集名稱。

1. 選擇**事件**索引標籤。

**事件**索引標籤會顯示事件分頁清單，其中包含事件層級、事件 ID、資源名稱、資源類型、描述和事件時間的資料欄。您可以使用搜尋方塊依屬性篩選事件、依事件時間排序，然後選擇事件 ID 以查看完整的事件詳細資訊，包括事件中繼資料和完整的事件記錄。

## 使用 CLI AWS 列出事件
<a name="sagemaker-hyperpod-cluster-events-slurm-cli"></a>

使用 `list-cluster-events`命令來擷取叢集的事件：

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --sort-by EventTime \
    --sort-order Descending \
    --max-results 20
```

您可以使用下列篩選條件縮小結果：
+ `--resource-type` — 依 `Cluster`、 `InstanceGroup`或 篩選`Instance`。
+ `--instance-group-name` — 篩選至特定執行個體群組的事件。
+ `--node-id` — 篩選特定 EC2 執行個體的事件。
+ `--event-time-after` 和 `--event-time-before` — 篩選至特定時段。

例如，若要僅查看特定instance-group-level事件：

```
aws sagemaker list-cluster-events \
    --cluster-name my-slurm-cluster \
    --resource-type InstanceGroup \
    --instance-group-name gpu-workers
```

## 描述特定事件
<a name="sagemaker-hyperpod-cluster-events-slurm-describe"></a>

使用 `describe-cluster-event`命令搭配清單輸出中的事件 ID 來擷取完整的事件詳細資訊，包括 `EventLevel`、 `Description`和 `EventMetadata`：

```
aws sagemaker describe-cluster-event \
    --cluster-name my-slurm-cluster \
    --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205
```

如需傳回事件記錄的結構和每個欄位的說明，請參閱 HyperPod 叢集事件參考[叢集事件記錄](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-record)中的 。

## 使用 Amazon EventBridge 自動化回應
<a name="sagemaker-hyperpod-cluster-events-slurm-eventbridge"></a>

HyperPod 叢集事件會在詳細資訊類型 下自動傳送至 Amazon EventBridge`SageMaker HyperPod Cluster Event`，讓您能夠將事件路由至目標，例如 Lambda、Amazon SNS、Step Functions 或 Amazon SQS。您可以在 `EventLevel` 欄位上進行篩選，以僅針對`Error`事件觸發警示，或依叢集 ARN 篩選，以將規則範圍限定在特定叢集。

如需 EventBridge 事件模式、承載範例，以及相關`SageMaker HyperPod Cluster State Change`和`SageMaker HyperPod Cluster Node Health Event`詳細資訊類型，請參閱 HyperPod 叢集事件參考[EventBridge 整合](sagemaker-hyperpod-cluster-events-reference.md#sagemaker-hyperpod-cluster-events-eventbridge)中的 。

## 相關主題
<a name="sagemaker-hyperpod-cluster-events-slurm-related"></a>
+ [SageMaker HyperPod 叢集事件參考](sagemaker-hyperpod-cluster-events-reference.md)
+ [Amazon SageMaker AI 傳送至 Amazon EventBridge 的事件](https://docs.aws.amazon.com/sagemaker/latest/dg/automating-sagemaker-with-eventbridge.html)