View a markdown version of this page

SageMaker HyperPod référence des événements du cluster - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

SageMaker HyperPod référence des événements du cluster

Cette page fournit une référence complète de tous les événements structurés émis par les SageMaker HyperPod clusters Amazon. Les événements fournissent une visibilité sur les opérations au niveau du cluster, du groupe d'instances et de l'instance, notamment le provisionnement, la mise à l'échelle, l'application de correctifs et les modifications du cycle de vie spécifiques à l'orchestrateur.

Les événements de cluster sont disponibles pour les HyperPod clusters NodeProvisioningMode définis surContinuous. Les événements sont accessibles via les DescribeClusterEvent API ListClusterEvents et, l'onglet Événements de la console SageMaker AI et Amazon EventBridge.

Record des événements du cluster

Chaque événement de cluster est représenté sous la forme d'un enregistrement structuré contenant l'identification, le calendrier, la portée, la gravité et des métadonnées spécifiques à l'opération. L'exemple suivant montre un enregistrement d'événement complet tel que diffusé via l'DescribeClusterEventAPI et Amazon EventBridge :

{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }

Champs d'enregistrement d'événements

L'objet detail.EventDetails comporte les champs suivants :

Champ Type Obligatoire Description
EventId Chaîne (UUID) Oui Identifiant unique de l'événement.
ClusterArn Chaîne Oui ARN du HyperPod cluster.
ClusterName Chaîne Oui Nom du HyperPod cluster.
EventTime Horodatage Oui Date à laquelle l'événement s'est produit (millisecondes d'époque).
ResourceType Chaîne Oui Portée de l'événement : ClusterInstanceGroup, ouInstance.
EventLevel Chaîne Oui Classification de gravité : InfoWarn,, ouError.
Description Chaîne Non Human-readable résumé de l'événement.
InstanceGroupName Chaîne Non Nom du groupe d'instances (présent quand ResourceType c'est InstanceGroup ouInstance).
InstanceId Chaîne Non ID d'instance EC2 (présent lorsqu'il ResourceType estInstance).
EventDetails Objet Non Métadonnées supplémentaires spécifiques au type de ressource et à l'opération.

Niveaux d'événements

Niveau Signification
Info L'opération s'est terminée avec succès ou se déroule normalement.
Warn L'opération s'est terminée avec un problème non critique ou une condition qui pourrait nécessiter une attention ultérieure.
Error L'opération a échoué ou nécessite une attention immédiate.

Types de ressources

ResourceType Scope Exemples d’événements
Cluster Whole-cluster opérations Cluster creation/update démarré, échec de l'opération du cluster
InstanceGroup Opérations sur les groupes d'instances Mise à l'échelle started/completed, application de correctifs planifiée, cycle de vie FSx
Instance Opérations sur les instances individuelles Approvisionnement EC2, exécution de scripts de cycle de vie, gestion ENI, terminaison

EventDetails métadonnées

Les événements de cluster incluent un EventMetadata objet dans le EventDetails champ qui fournit un contexte spécifique à l'opération au-delà de ce que la description de l'événement indique. Le contenu de EventMetadata varie selon le type de ressource et le type d'événement. Pour le schéma complet et les champs pris en charge, consultez EventMetadata le manuel Amazon SageMaker AI API Reference.

EventBridge champs d'enveloppe

Lorsqu'il est livré via Amazon EventBridge, l'enregistrement de l'événement est emballé dans EventBridge une enveloppe standard :

Champ Description
version EventBridge version du schéma (toujours"0").
id ID EventBridge d'événement unique.
detail-type SageMaker HyperPod Cluster Event
source aws.sagemaker
account AWS ID de compte propriétaire du cluster.
time Horodatage ISO 8601 de l'événement.
region AWS Région dans laquelle se trouve le cluster.
resources Tableau contenant l'ARN du cluster.
detail Contient l'EventDetailsobjet décrit ci-dessus.

Événements courants (EKS et Slurm)

Les événements suivants sont émis pour tous les HyperPod clusters, quel que soit l'orchestrateur. La colonne Description affiche la valeur du Description champ dans l'enregistrement d'événement telle qu'elle apparaît dans la réponse de l'API et dans l'onglet Événements de la console.

Cycle de vie d'un cluster

Événement Description
L'opération du cluster a commencé Le cluster <cluster-name><operation>a démarré avec succès
Le démarrage de l'opération du cluster a échoué Impossible de démarrer le cluster <cluster-name><operation>
L'opération du cluster est terminée Le cluster <cluster-name><operation>s'est terminé avec succès
Échec de l'opération du cluster Le cluster <cluster-name><operation>a échoué

Cycle de vie des groupes d'instances

Événement Description
L'opération du groupe d'instances a commencé InstanceGroup <instance-group-name><operation>a démarré avec succès dans Cluster <cluster-name>
Le démarrage de l'opération du groupe d'instances a échoué Impossible de démarrer InstanceGroup <instance-group-name><operation>dans le cluster <cluster-name>
L'opération du groupe d'instances est terminée Le groupe d'instances <instance-group-name><operation>du cluster s'<cluster-name>est terminé avec succès
L'opération du groupe d'instances a échoué Le groupe d'instances <instance-group-name><operation>du cluster <cluster-name>a échoué

Configuration réseau du groupe d'instances

Événement Description
Configuration réseau détectée Sous-réseau trouvé <subnet-id>dans AZ <availability-zone>avec SecurityGroupIds <security-group-ids>pour IG <instance-group-name>dans Cluster <cluster-name>
La configuration réseau a échoué Impossible de traiter les détails de configuration réseau du groupe d'instances pour IG <instance-group-name>in Cluster <cluster-name>
Un remplacement d'AMI personnalisé a été détecté Un remplacement d'AMI personnalisé a été trouvé <ami-id>pour IG <instance-group-name>dans le cluster <cluster-name>
Le remplacement de l'AMI personnalisée a échoué Impossible de traiter les détails de remplacement de l'AMI personnalisée pour IG <instance-group-name>dans le cluster <cluster-name>
Configuration réseau de la plate-forme utilisée Utilisation de HyperPod la configuration réseau fournie par la plate-forme pour IG <instance-group-name>in Cluster <cluster-name>
Configuration réseau déterminée Configuration réseau du groupe d'instances déterminée avec succès pour IG <instance-group-name>in Cluster <cluster-name>

Création d'instance

Événement Description
L'opération de l'instance a commencé L'instance <operation>a démarré avec succès dans Cluster <cluster-name>et IG <instance-group-name>
Le démarrage de l'opération d'instance a échoué Impossible de démarrer l'instance <operation>dans le cluster <cluster-name>et l'IG <instance-group-name>
Réservation de capacité trouvée CapacityReservation Identifiant trouvé <reservation-id>pour le cluster <cluster-name>et l'IG<instance-group-name>, en utilisant la capacité réservée
Réservation de capacité introuvable Aucun résultat CapacityReservation trouvé pour Cluster <cluster-name>et IG<instance-group-name>, utilisant un pool à la demande
La configuration de la charge utile de l'instance a échoué Echec du traitement CapacityReservationDetails pour Cluster <cluster-name>et IG <instance-group-name>
Le client ENI a créé Client ENI créé avec succès, par exemple dans Cluster <cluster-name>et IG <instance-group-name>
La création de l'ENI client a échoué Impossible de créer l'ENI client par exemple dans Cluster <cluster-name>et IG <instance-group-name>
Instance EC2 provisionnée <cluster-name>Instance EC2 <instance-id>correctement provisionnée dans Cluster et IG <instance-group-name>
La création de l'instance EC2 a échoué Impossible de provisionner l'instance EC2 dans le cluster <cluster-name>et l'IG <instance-group-name>
État du script Lifecycle mis à jour <instance-id>L'exécution du script du cycle de vie de l'instance pour l'instance EC2 a <status>
La mise à jour de l'état du script Lifecycle Impossible de mettre à jour l'état d'exécution du script du cycle de vie de l'instance pour EC2InstanceId <instance-id>
La création d'instance a échoué avec les journaux du cycle de vie L'exécution du script du cycle de vie de l'instance pour l'instance EC2 <instance-id>a échoué. Pour consulter les journaux des scripts du cycle de vie, consultez le groupe de journaux...
Le nettoyage de l'ENI non utilisé a réussi <cluster-name>Suppression réussie des ENI client inutilisés pour l'instance EC2 <instance-id>dans le cluster et l'IG <instance-group-name>
Le nettoyage de l'ENI non utilisé a échoué <cluster-name>Impossible de supprimer les ENI client inutilisés pour l'instance EC2 <instance-id>dans le cluster et l'IG <instance-group-name>

Suppression d'instance

Événement Description
Arrêt de l'instance EC2 en cours La résiliation de l'instance EC2 <instance-id>est actuellement en cours dans Cluster <cluster-name>et IG <instance-group-name>
Échec de la terminaison de l'instance EC2 Impossible de mettre fin à l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>
Le client ENI a été supprimé L'ENI du client a été supprimée avec succès pour l'instance EC2 <instance-id>dans Cluster <cluster-name>et IG <instance-group-name>
La suppression de l'ENI client a échoué Impossible de supprimer l'ENI client pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>

Redémarrage d’instance

Événement Description
Redémarrage de l'instance EC2 en cours Le redémarrage de l'instance EC2 <instance-id>est en cours sur Cluster <cluster-name>et IG <instance-group-name>
La demande de redémarrage de l'instance EC2 a échoué Impossible de soumettre la demande de redémarrage pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name>

Fonctionnement de l'instance (générique)

Événement Description
L'opération de l'instance est terminée Instance <operation><instance-id>dans Cluster <cluster-name>et IG <instance-group-name>terminée avec succès
L'opération de l'instance a échoué L'instance <operation><instance-id>du cluster <cluster-name>et de l'IG <instance-group-name>a échoué

Remplacement de l'instance

Événement Description
Le remplacement de l'instance a commencé <instance-id>L'instance démarre dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>
Le démarrage du remplacement de l'instance a échoué L'instance <instance-id>n'a pas pu démarrer dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>
Remplacement de l'instance terminé Instance <instance-id><operation>terminée avec succès dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>
Le remplacement de l'instance a échoué L'instance <instance-id><operation>a échoué lors du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name>

Cycle de vie du système de fichiers FSx

Événement Description
La création de FSx a commencé La création de FSx a commencé pour IG <instance-group-name>in Cluster <cluster-name>
La création de FSx a échoué Impossible de créer FSx pour IG <instance-group-name>dans le cluster <cluster-name>
Création de FSx terminée Création de FSx terminée avec succès pour IG <instance-group-name>in Cluster <cluster-name>
La suppression de FSx a commencé La suppression de FSx a commencé pour IG <instance-group-name>dans Cluster <cluster-name>
La suppression de FSx a échoué Impossible de supprimer FSx pour IG <instance-group-name>dans le cluster <cluster-name>
Suppression de FSx terminée Suppression de FSx terminée avec succès pour IG <instance-group-name>in Cluster <cluster-name>
La mise à jour de FSx a commencé La mise à jour de FSx a commencé pour IG <instance-group-name>in Cluster <cluster-name>
La mise à jour de FSx a échoué Impossible de mettre à jour FSx pour IG <instance-group-name>dans le cluster <cluster-name>
Mise à jour de FSx terminée Mise à jour de FSx terminée avec succès pour IG <instance-group-name>in Cluster <cluster-name>

Application de correctifs (étapes courantes)

Ces événements de correction sont émis à la fois pour les clusters EKS et Slurm pendant les opérations. UpdateClusterSoftware

Événement Description
Application de correctifs aux groupes d'instances planifiée InstanceGroup <instance-group-name>in Cluster <cluster-name>a été programmé UpdateClusterSoftware pour le plus tard.
Échec du calendrier d'application des correctifs pour les groupes d'instances Impossible de planifier UpdateClusterSoftware l'IG <instance-group-name>dans le cluster<cluster-name>.
L'application de correctifs aux groupes d'instances a commencé UpdateClusterSoftware initié pour IG <instance-group-name>in Cluster en <cluster-name>utilisant <strategy>la stratégie.
Le démarrage de l'application des correctifs au groupe d'instances a échoué Impossible de démarrer UpdateClusterSoftware pour IG <instance-group-name>dans le cluster<cluster-name>.
Lot de correctifs suivant sélectionné Prochain lot de mise à jour sélectionné pour IG <instance-group-name>in Cluster<cluster-name>.
La sélection du lot de correctifs suivant a échoué Impossible de sélectionner le prochain lot de mise à jour pour IG <instance-group-name>in Cluster<cluster-name>.
Instances défaillantes mises en file d'attente pour remplacement Instances défaillantes dans IG <instance-group-name>in Cluster mises en <cluster-name>file d'attente pour le remplacement du nœud.
Échec de la mise en file d'attente de remplacement d'instance Impossible de mettre les instances en file d'attente pour le remplacement du nœud dans IG <instance-group-name>in Cluster<cluster-name>.
L'application de correctifs aux groupes d'instances est terminée UpdateClusterSoftware terminé avec succès pour IG <instance-group-name>in Cluster<cluster-name>.
Échec de l'application des correctifs aux groupes d'instances Impossible de terminer UpdateClusterSoftware pour IG <instance-group-name>in Cluster<cluster-name>.
Le remplacement du volume racinaire a commencé Le remplacement du volume racine a commencé pour Instance <instance-id>dans IG<instance-group-name>.
Le remplacement du volume racine a échoué Impossible de démarrer le remplacement du volume racine pour l'instance <instance-id>dans IG<instance-group-name>.
L'application des correctifs à l'instance a réussi L'instance <instance-id>dans IG a <instance-group-name>été mise à jour avec succès.

EKS-specific événements

Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Amazon EKS.

Gestion des entrées d'accès

Événement Description
L'opération de saisie d'accès au SLR a réussi Entrée <operation>réussie au SLR Access pour Cluster <cluster-name>
Échec de l'opération de saisie d'accès au SLR <operation>Échec de l'entrée d'accès au SLR pour le cluster <cluster-name>
L'opération des entrées d'accès EKS a réussi Entrées d'accès EKS <operation>réussies pour Cluster <cluster-name>
Échec de l'opération des entrées d'accès EKS Les entrées d'accès EKS <operation>ont échoué pour le cluster <cluster-name>

Mises à jour de configuration de Kubernetes

Événement Description
La mise à jour de la configuration de Kubernetes a réussi <cluster-name>Configuration Kubernetes mise à jour avec succès, par exemple <instance-id>dans Cluster et IG <instance-group-name>
La mise à jour de la configuration de Kubernetes a échoué <cluster-name>Impossible de mettre à jour la configuration de Kubernetes par exemple <instance-id>dans Cluster et IG <instance-group-name>

Mise à l'échelle automatique Karpenter

Événement Description
L'opération de dimensionnement automatique a réussi AutoScaling <operation><status>avec succès dans Cluster <cluster-name>
L'opération de dimensionnement automatique a échoué Impossible d'accéder <operation> AutoScaling au cluster <cluster-name>
L'installation du Karpenter CRD s'est déroulée avec succès CustomResourceDefinition l'installation s'est terminée avec succès dans EKS Cluster <cluster-name>
L'installation de Karpenter CRD a échoué CustomResourceDefinition échec de l'installation pour EKS Cluster <cluster-name>
Mise à jour de la politique d'accès aux appareils photo reflex Karpenter réussie <operation>politiques d'accès avec entrée AmazonSageMakerHyperPodServiceRole d'accès dans le cluster EKS <cluster-name>avec succès
La mise à jour de la politique d'accès aux appareils photo reflex Karpenter a échoué Impossible d'<operation>accéder aux politiques avec entrée AmazonSageMakerHyperPodServiceRole d'accès dans le cluster EKS <cluster-name>

Application de correctifs au niveau de l'instance EKS

Événement Description
La préparation des correctifs d'instance a réussi Par exemple, <instance-id>IG a <instance-group-name>été bouclé et les cabines ont été expulsées.
Application de correctifs d'instance ignorée (violation PDB) UpdateClusterSoftware pour Instance <instance-id>dans IG <instance-group-name>ignorée en raison d' PodDisruptionBudget une contrainte.
La préparation de l'application des correctifs d'instance a échoué Impossible de préparer l'instance <instance-id>dans IG <instance-group-name>pour UpdateClusterSoftware.
Instance restaurée à l'état planifiable Instance <instance-id>dans IG <instance-group-name>restaurée à l'état planifiable.
La restauration de l'instance vers une instance planifiable a échoué Impossible de restaurer l'état <instance-id><instance-group-name>planifiable de l'instance dans IG.

Application de correctifs — Annulation EKS

Événement Description
Le temps de cuisson a commencé La période de cuisson a commencé pour IG <instance-group-name>in Cluster<cluster-name>. Surveiller les alarmes [<alarm-names>] pendant <duration>quelques secondes.
Temps de cuisson terminé La période de cuisson est terminée pour IG <instance-group-name>in Cluster<cluster-name>. Aucune alarme n'a été déclenchée pendant la <duration>période de cuisson de 2 secondes.
Alarme de temps de cuisson déclenchée La période de cuisson a échoué pour IG <instance-group-name>in Cluster<cluster-name>. Les alarmes [<alarm-names>] sont entrées dans l'état ALARME. Initiation de la restauration automatique.
Echec de l'évaluation du temps de cuisson Impossible d'évaluer les alarmes pendant la période de cuisson pour IG <instance-group-name>in Cluster<cluster-name>.
Annulation de l'application des correctifs aux groupes d'instances initiée UpdateClusterSoftware échec pour IG <instance-group-name>dans Cluster<cluster-name>. Initiation de la restauration.
Échec de l'annulation de l'application des correctifs aux groupes d'instances <cluster-name>La restauration a échoué pour IG <instance-group-name>in Cluster. Certains cas peuvent être en FailedMaintenance cours.
Annulation de l'application des correctifs de l'instance initiée L'instance <instance-id>dans IG <instance-group-name>n'a pas pu être mise à jour. La restauration a été initiée.
L'annulation de l'application des correctifs de l'instance a réussi L'instance <instance-id>dans IG <instance-group-name>est revenue avec succès à l'AMI précédente.
Échec de la restauration des correctifs de l'instance UpdateClusterSoftware <instance-group-name>la restauration a échoué, par exemple <instance-id>dans IG.

Slurm-specific événements

Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Slurm.

Événement Description
Paramètres de provisionnement trouvés Provisioning_parameters.json trouvé dans le chemin S3 pour le groupe de contrôleurs LifeCycleScript <instance-group-name>
Paramètres de provisionnement introuvables Aucun provisioning_parameters.json n'a été trouvé dans S3 Path pour le groupe de contrôleurs LifeCycleScript <instance-group-name>
Clé Slurm Munge créée Clé munge créée et stockée avec succès
Validation de la dérive du slurm réussie Validation de la dérive de la configuration de Slurm réussie
Dérive de boue détectée Dérive de configuration du slurm détectée : <drift-details>
La restauration du cluster Slurm est terminée Échec de la création du cluster : le contrôleur et les nœuds de connexion ne sont pas prêts dans les délais prévus
La reconfiguration de Slurm a réussi Slurm a été reconfiguré avec succès. Configuration de Slurm mise à jour pour correspondre à l'état souhaité

EventBridge intégration

HyperPod envoie des événements de cluster à Amazon EventBridge en utilisant trois types de détails :

Type de détail Description
SageMaker HyperPod Cluster Event Événements opérationnels pour le provisionnement, la mise à l'échelle, l'application de correctifs et les opérations spécifiques à l'orchestrateur. Comprend EventLevel le filtrage de gravité.
SageMaker HyperPod Cluster State Change Cluster-level transitions de statut (par exemple, Création vers InService). Inclut la configuration complète du cluster.
SageMaker HyperPod Cluster Node Health Event Événements de surveillance de la HyperPod santé émis par l'agent de surveillance de la santé (HMA). Comprend l'état de santé, la raison, les mesures de réparation et les recommandations.

Exemples de modèles d'événements

Tous les événements HyperPod du cluster :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }

Événements d'erreur uniquement (pour les alertes) :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }

Événements pour un cluster spécifique :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }

Événements liés à l'état des nœuds :

{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }

Référence des API

Consultez aussi