Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
SageMaker HyperPod référence des événements du cluster
Cette page fournit une référence complète de tous les événements structurés émis par les SageMaker HyperPod clusters Amazon. Les événements fournissent une visibilité sur les opérations au niveau du cluster, du groupe d'instances et de l'instance, notamment le provisionnement, la mise à l'échelle, l'application de correctifs et les modifications du cycle de vie spécifiques à l'orchestrateur.
Les événements de cluster sont disponibles pour les HyperPod clusters NodeProvisioningMode définis surContinuous. Les événements sont accessibles via les DescribeClusterEvent API ListClusterEvents et, l'onglet Événements de la console SageMaker AI et Amazon EventBridge.
Record des événements du cluster
Chaque événement de cluster est représenté sous la forme d'un enregistrement structuré contenant l'identification, le calendrier, la portée, la gravité et des métadonnées spécifiques à l'opération. L'exemple suivant montre un enregistrement d'événement complet tel que diffusé via l'DescribeClusterEventAPI et Amazon EventBridge :
{ "version": "0", "id": "0bd4a141-0a02-9d8a-f977-3924c3fb259c", "detail-type": "SageMaker HyperPod Cluster Event", "source": "aws.sagemaker", "account": "111122223333", "time": "2026-06-01T17:20:25Z", "region": "us-west-2", "resources": [ "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster" ], "detail": { "EventDetails": { "EventId": "83ea0bb5-be77-45e8-a458-0a87f778a205", "ClusterArn": "arn:aws:sagemaker:us-west-2:111122223333:cluster/sample-cluster", "ClusterName": "sample-cluster", "InstanceGroupName": "p5Inst", "InstanceId": "i-0391f86fa0fe0d465", "ResourceType": "Instance", "EventTime": 1748794825350, "EventLevel": "Error", "Description": "Instance creation in Cluster sample-cluster and InstanceGroup p5Inst failed", "EventDetails": { "EventMetadata": { "Instance": { "FailureMessage": "We currently do not have sufficient capacity to launch new ml.p5.48xlarge instances. Please try again.", "NodeLogicalId": "df268d19-f035-4f28-9b80-b956b92ae21e" } } } } } }
Champs d'enregistrement d'événements
L'objet detail.EventDetails comporte les champs suivants :
| Champ | Type | Obligatoire | Description |
|---|---|---|---|
EventId |
Chaîne (UUID) | Oui | Identifiant unique de l'événement. |
ClusterArn |
Chaîne | Oui | ARN du HyperPod cluster. |
ClusterName |
Chaîne | Oui | Nom du HyperPod cluster. |
EventTime |
Horodatage | Oui | Date à laquelle l'événement s'est produit (millisecondes d'époque). |
ResourceType |
Chaîne | Oui | Portée de l'événement : ClusterInstanceGroup, ouInstance. |
EventLevel |
Chaîne | Oui | Classification de gravité : InfoWarn,, ouError. |
Description |
Chaîne | Non | Human-readable résumé de l'événement. |
InstanceGroupName |
Chaîne | Non | Nom du groupe d'instances (présent quand ResourceType c'est InstanceGroup ouInstance). |
InstanceId |
Chaîne | Non | ID d'instance EC2 (présent lorsqu'il ResourceType estInstance). |
EventDetails |
Objet | Non | Métadonnées supplémentaires spécifiques au type de ressource et à l'opération. |
Niveaux d'événements
| Niveau | Signification |
|---|---|
Info |
L'opération s'est terminée avec succès ou se déroule normalement. |
Warn |
L'opération s'est terminée avec un problème non critique ou une condition qui pourrait nécessiter une attention ultérieure. |
Error |
L'opération a échoué ou nécessite une attention immédiate. |
Types de ressources
| ResourceType | Scope | Exemples d’événements |
|---|---|---|
Cluster |
Whole-cluster opérations | Cluster creation/update démarré, échec de l'opération du cluster |
InstanceGroup |
Opérations sur les groupes d'instances | Mise à l'échelle started/completed, application de correctifs planifiée, cycle de vie FSx |
Instance |
Opérations sur les instances individuelles | Approvisionnement EC2, exécution de scripts de cycle de vie, gestion ENI, terminaison |
EventDetails métadonnées
Les événements de cluster incluent un EventMetadata objet dans le EventDetails champ qui fournit un contexte spécifique à l'opération au-delà de ce que la description de l'événement indique. Le contenu de EventMetadata varie selon le type de ressource et le type d'événement. Pour le schéma complet et les champs pris en charge, consultez EventMetadata le manuel Amazon SageMaker AI API Reference.
EventBridge champs d'enveloppe
Lorsqu'il est livré via Amazon EventBridge, l'enregistrement de l'événement est emballé dans EventBridge une enveloppe standard :
| Champ | Description |
|---|---|
version |
EventBridge version du schéma (toujours"0"). |
id |
ID EventBridge d'événement unique. |
detail-type |
SageMaker HyperPod Cluster Event |
source |
aws.sagemaker |
account |
AWS ID de compte propriétaire du cluster. |
time |
Horodatage ISO 8601 de l'événement. |
region |
AWS Région dans laquelle se trouve le cluster. |
resources |
Tableau contenant l'ARN du cluster. |
detail |
Contient l'EventDetailsobjet décrit ci-dessus. |
Événements courants (EKS et Slurm)
Les événements suivants sont émis pour tous les HyperPod clusters, quel que soit l'orchestrateur. La colonne Description affiche la valeur du Description champ dans l'enregistrement d'événement telle qu'elle apparaît dans la réponse de l'API et dans l'onglet Événements de la console.
Cycle de vie d'un cluster
| Événement | Description |
|---|---|
| L'opération du cluster a commencé | Le cluster <cluster-name><operation>a démarré avec succès |
| Le démarrage de l'opération du cluster a échoué | Impossible de démarrer le cluster <cluster-name><operation> |
| L'opération du cluster est terminée | Le cluster <cluster-name><operation>s'est terminé avec succès |
| Échec de l'opération du cluster | Le cluster <cluster-name><operation>a échoué |
Cycle de vie des groupes d'instances
| Événement | Description |
|---|---|
| L'opération du groupe d'instances a commencé | InstanceGroup <instance-group-name><operation>a démarré avec succès dans Cluster <cluster-name> |
| Le démarrage de l'opération du groupe d'instances a échoué | Impossible de démarrer InstanceGroup <instance-group-name><operation>dans le cluster <cluster-name> |
| L'opération du groupe d'instances est terminée | Le groupe d'instances <instance-group-name><operation>du cluster s'<cluster-name>est terminé avec succès |
| L'opération du groupe d'instances a échoué | Le groupe d'instances <instance-group-name><operation>du cluster <cluster-name>a échoué |
Configuration réseau du groupe d'instances
| Événement | Description |
|---|---|
| Configuration réseau détectée | Sous-réseau trouvé <subnet-id>dans AZ <availability-zone>avec SecurityGroupIds <security-group-ids>pour IG <instance-group-name>dans Cluster <cluster-name> |
| La configuration réseau a échoué | Impossible de traiter les détails de configuration réseau du groupe d'instances pour IG <instance-group-name>in Cluster <cluster-name> |
| Un remplacement d'AMI personnalisé a été détecté | Un remplacement d'AMI personnalisé a été trouvé <ami-id>pour IG <instance-group-name>dans le cluster <cluster-name> |
| Le remplacement de l'AMI personnalisée a échoué | Impossible de traiter les détails de remplacement de l'AMI personnalisée pour IG <instance-group-name>dans le cluster <cluster-name> |
| Configuration réseau de la plate-forme utilisée | Utilisation de HyperPod la configuration réseau fournie par la plate-forme pour IG <instance-group-name>in Cluster <cluster-name> |
| Configuration réseau déterminée | Configuration réseau du groupe d'instances déterminée avec succès pour IG <instance-group-name>in Cluster <cluster-name> |
Création d'instance
| Événement | Description |
|---|---|
| L'opération de l'instance a commencé | L'instance <operation>a démarré avec succès dans Cluster <cluster-name>et IG <instance-group-name> |
| Le démarrage de l'opération d'instance a échoué | Impossible de démarrer l'instance <operation>dans le cluster <cluster-name>et l'IG <instance-group-name> |
| Réservation de capacité trouvée | CapacityReservation Identifiant trouvé <reservation-id>pour le cluster <cluster-name>et l'IG<instance-group-name>, en utilisant la capacité réservée |
| Réservation de capacité introuvable | Aucun résultat CapacityReservation trouvé pour Cluster <cluster-name>et IG<instance-group-name>, utilisant un pool à la demande |
| La configuration de la charge utile de l'instance a échoué | Echec du traitement CapacityReservationDetails pour Cluster <cluster-name>et IG <instance-group-name> |
| Le client ENI a créé | Client ENI créé avec succès, par exemple dans Cluster <cluster-name>et IG <instance-group-name> |
| La création de l'ENI client a échoué | Impossible de créer l'ENI client par exemple dans Cluster <cluster-name>et IG <instance-group-name> |
| Instance EC2 provisionnée | <cluster-name>Instance EC2 <instance-id>correctement provisionnée dans Cluster et IG <instance-group-name> |
| La création de l'instance EC2 a échoué | Impossible de provisionner l'instance EC2 dans le cluster <cluster-name>et l'IG <instance-group-name> |
| État du script Lifecycle mis à jour | <instance-id>L'exécution du script du cycle de vie de l'instance pour l'instance EC2 a <status> |
| La mise à jour de l'état du script Lifecycle | Impossible de mettre à jour l'état d'exécution du script du cycle de vie de l'instance pour EC2InstanceId <instance-id> |
| La création d'instance a échoué avec les journaux du cycle de vie | L'exécution du script du cycle de vie de l'instance pour l'instance EC2 <instance-id>a échoué. Pour consulter les journaux des scripts du cycle de vie, consultez le groupe de journaux... |
| Le nettoyage de l'ENI non utilisé a réussi | <cluster-name>Suppression réussie des ENI client inutilisés pour l'instance EC2 <instance-id>dans le cluster et l'IG <instance-group-name> |
| Le nettoyage de l'ENI non utilisé a échoué | <cluster-name>Impossible de supprimer les ENI client inutilisés pour l'instance EC2 <instance-id>dans le cluster et l'IG <instance-group-name> |
Suppression d'instance
| Événement | Description |
|---|---|
| Arrêt de l'instance EC2 en cours | La résiliation de l'instance EC2 <instance-id>est actuellement en cours dans Cluster <cluster-name>et IG <instance-group-name> |
| Échec de la terminaison de l'instance EC2 | Impossible de mettre fin à l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name> |
| Le client ENI a été supprimé | L'ENI du client a été supprimée avec succès pour l'instance EC2 <instance-id>dans Cluster <cluster-name>et IG <instance-group-name> |
| La suppression de l'ENI client a échoué | Impossible de supprimer l'ENI client pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name> |
Redémarrage d’instance
| Événement | Description |
|---|---|
| Redémarrage de l'instance EC2 en cours | Le redémarrage de l'instance EC2 <instance-id>est en cours sur Cluster <cluster-name>et IG <instance-group-name> |
| La demande de redémarrage de l'instance EC2 a échoué | Impossible de soumettre la demande de redémarrage pour l'instance EC2 <instance-id>dans le cluster <cluster-name>et l'IG <instance-group-name> |
Fonctionnement de l'instance (générique)
| Événement | Description |
|---|---|
| L'opération de l'instance est terminée | Instance <operation><instance-id>dans Cluster <cluster-name>et IG <instance-group-name>terminée avec succès |
| L'opération de l'instance a échoué | L'instance <operation><instance-id>du cluster <cluster-name>et de l'IG <instance-group-name>a échoué |
Remplacement de l'instance
| Événement | Description |
|---|---|
| Le remplacement de l'instance a commencé | <instance-id>L'instance démarre dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
| Le démarrage du remplacement de l'instance a échoué | L'instance <instance-id>n'a pas pu démarrer dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
| Remplacement de l'instance terminé | Instance <instance-id><operation>terminée avec succès dans le cadre du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
| Le remplacement de l'instance a échoué | L'instance <instance-id><operation>a échoué lors du remplacement de l'instance dans Cluster <cluster-name>et IG <instance-group-name> |
Cycle de vie du système de fichiers FSx
| Événement | Description |
|---|---|
| La création de FSx a commencé | La création de FSx a commencé pour IG <instance-group-name>in Cluster <cluster-name> |
| La création de FSx a échoué | Impossible de créer FSx pour IG <instance-group-name>dans le cluster <cluster-name> |
| Création de FSx terminée | Création de FSx terminée avec succès pour IG <instance-group-name>in Cluster <cluster-name> |
| La suppression de FSx a commencé | La suppression de FSx a commencé pour IG <instance-group-name>dans Cluster <cluster-name> |
| La suppression de FSx a échoué | Impossible de supprimer FSx pour IG <instance-group-name>dans le cluster <cluster-name> |
| Suppression de FSx terminée | Suppression de FSx terminée avec succès pour IG <instance-group-name>in Cluster <cluster-name> |
| La mise à jour de FSx a commencé | La mise à jour de FSx a commencé pour IG <instance-group-name>in Cluster <cluster-name> |
| La mise à jour de FSx a échoué | Impossible de mettre à jour FSx pour IG <instance-group-name>dans le cluster <cluster-name> |
| Mise à jour de FSx terminée | Mise à jour de FSx terminée avec succès pour IG <instance-group-name>in Cluster <cluster-name> |
Application de correctifs (étapes courantes)
Ces événements de correction sont émis à la fois pour les clusters EKS et Slurm pendant les opérations. UpdateClusterSoftware
| Événement | Description |
|---|---|
| Application de correctifs aux groupes d'instances planifiée | InstanceGroup <instance-group-name>in Cluster <cluster-name>a été programmé UpdateClusterSoftware pour le plus tard. |
| Échec du calendrier d'application des correctifs pour les groupes d'instances | Impossible de planifier UpdateClusterSoftware l'IG <instance-group-name>dans le cluster<cluster-name>. |
| L'application de correctifs aux groupes d'instances a commencé | UpdateClusterSoftware initié pour IG <instance-group-name>in Cluster en <cluster-name>utilisant <strategy>la stratégie. |
| Le démarrage de l'application des correctifs au groupe d'instances a échoué | Impossible de démarrer UpdateClusterSoftware pour IG <instance-group-name>dans le cluster<cluster-name>. |
| Lot de correctifs suivant sélectionné | Prochain lot de mise à jour sélectionné pour IG <instance-group-name>in Cluster<cluster-name>. |
| La sélection du lot de correctifs suivant a échoué | Impossible de sélectionner le prochain lot de mise à jour pour IG <instance-group-name>in Cluster<cluster-name>. |
| Instances défaillantes mises en file d'attente pour remplacement | Instances défaillantes dans IG <instance-group-name>in Cluster mises en <cluster-name>file d'attente pour le remplacement du nœud. |
| Échec de la mise en file d'attente de remplacement d'instance | Impossible de mettre les instances en file d'attente pour le remplacement du nœud dans IG <instance-group-name>in Cluster<cluster-name>. |
| L'application de correctifs aux groupes d'instances est terminée | UpdateClusterSoftware terminé avec succès pour IG <instance-group-name>in Cluster<cluster-name>. |
| Échec de l'application des correctifs aux groupes d'instances | Impossible de terminer UpdateClusterSoftware pour IG <instance-group-name>in Cluster<cluster-name>. |
| Le remplacement du volume racinaire a commencé | Le remplacement du volume racine a commencé pour Instance <instance-id>dans IG<instance-group-name>. |
| Le remplacement du volume racine a échoué | Impossible de démarrer le remplacement du volume racine pour l'instance <instance-id>dans IG<instance-group-name>. |
| L'application des correctifs à l'instance a réussi | L'instance <instance-id>dans IG a <instance-group-name>été mise à jour avec succès. |
EKS-specific événements
Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Amazon EKS.
Gestion des entrées d'accès
| Événement | Description |
|---|---|
| L'opération de saisie d'accès au SLR a réussi | Entrée <operation>réussie au SLR Access pour Cluster <cluster-name> |
| Échec de l'opération de saisie d'accès au SLR | <operation>Échec de l'entrée d'accès au SLR pour le cluster <cluster-name> |
| L'opération des entrées d'accès EKS a réussi | Entrées d'accès EKS <operation>réussies pour Cluster <cluster-name> |
| Échec de l'opération des entrées d'accès EKS | Les entrées d'accès EKS <operation>ont échoué pour le cluster <cluster-name> |
Mises à jour de configuration de Kubernetes
| Événement | Description |
|---|---|
| La mise à jour de la configuration de Kubernetes a réussi | <cluster-name>Configuration Kubernetes mise à jour avec succès, par exemple <instance-id>dans Cluster et IG <instance-group-name> |
| La mise à jour de la configuration de Kubernetes a échoué | <cluster-name>Impossible de mettre à jour la configuration de Kubernetes par exemple <instance-id>dans Cluster et IG <instance-group-name> |
Mise à l'échelle automatique Karpenter
| Événement | Description |
|---|---|
| L'opération de dimensionnement automatique a réussi | AutoScaling <operation><status>avec succès dans Cluster <cluster-name> |
| L'opération de dimensionnement automatique a échoué | Impossible d'accéder <operation> AutoScaling au cluster <cluster-name> |
| L'installation du Karpenter CRD s'est déroulée avec succès | CustomResourceDefinition l'installation s'est terminée avec succès dans EKS Cluster <cluster-name> |
| L'installation de Karpenter CRD a échoué | CustomResourceDefinition échec de l'installation pour EKS Cluster <cluster-name> |
| Mise à jour de la politique d'accès aux appareils photo reflex Karpenter réussie | <operation>politiques d'accès avec entrée AmazonSageMakerHyperPodServiceRole d'accès dans le cluster EKS <cluster-name>avec succès |
| La mise à jour de la politique d'accès aux appareils photo reflex Karpenter a échoué | Impossible d'<operation>accéder aux politiques avec entrée AmazonSageMakerHyperPodServiceRole d'accès dans le cluster EKS <cluster-name> |
Application de correctifs au niveau de l'instance EKS
| Événement | Description |
|---|---|
| La préparation des correctifs d'instance a réussi | Par exemple, <instance-id>IG a <instance-group-name>été bouclé et les cabines ont été expulsées. |
| Application de correctifs d'instance ignorée (violation PDB) | UpdateClusterSoftware pour Instance <instance-id>dans IG <instance-group-name>ignorée en raison d' PodDisruptionBudget une contrainte. |
| La préparation de l'application des correctifs d'instance a échoué | Impossible de préparer l'instance <instance-id>dans IG <instance-group-name>pour UpdateClusterSoftware. |
| Instance restaurée à l'état planifiable | Instance <instance-id>dans IG <instance-group-name>restaurée à l'état planifiable. |
| La restauration de l'instance vers une instance planifiable a échoué | Impossible de restaurer l'état <instance-id><instance-group-name>planifiable de l'instance dans IG. |
Application de correctifs — Annulation EKS
| Événement | Description |
|---|---|
| Le temps de cuisson a commencé | La période de cuisson a commencé pour IG <instance-group-name>in Cluster<cluster-name>. Surveiller les alarmes [<alarm-names>] pendant <duration>quelques secondes. |
| Temps de cuisson terminé | La période de cuisson est terminée pour IG <instance-group-name>in Cluster<cluster-name>. Aucune alarme n'a été déclenchée pendant la <duration>période de cuisson de 2 secondes. |
| Alarme de temps de cuisson déclenchée | La période de cuisson a échoué pour IG <instance-group-name>in Cluster<cluster-name>. Les alarmes [<alarm-names>] sont entrées dans l'état ALARME. Initiation de la restauration automatique. |
| Echec de l'évaluation du temps de cuisson | Impossible d'évaluer les alarmes pendant la période de cuisson pour IG <instance-group-name>in Cluster<cluster-name>. |
| Annulation de l'application des correctifs aux groupes d'instances initiée | UpdateClusterSoftware échec pour IG <instance-group-name>dans Cluster<cluster-name>. Initiation de la restauration. |
| Échec de l'annulation de l'application des correctifs aux groupes d'instances | <cluster-name>La restauration a échoué pour IG <instance-group-name>in Cluster. Certains cas peuvent être en FailedMaintenance cours. |
| Annulation de l'application des correctifs de l'instance initiée | L'instance <instance-id>dans IG <instance-group-name>n'a pas pu être mise à jour. La restauration a été initiée. |
| L'annulation de l'application des correctifs de l'instance a réussi | L'instance <instance-id>dans IG <instance-group-name>est revenue avec succès à l'AMI précédente. |
| Échec de la restauration des correctifs de l'instance | UpdateClusterSoftware <instance-group-name>la restauration a échoué, par exemple <instance-id>dans IG. |
Slurm-specific événements
Les événements suivants sont émis uniquement pour les HyperPod clusters orchestrés avec Slurm.
| Événement | Description |
|---|---|
| Paramètres de provisionnement trouvés | Provisioning_parameters.json trouvé dans le chemin S3 pour le groupe de contrôleurs LifeCycleScript <instance-group-name> |
| Paramètres de provisionnement introuvables | Aucun provisioning_parameters.json n'a été trouvé dans S3 Path pour le groupe de contrôleurs LifeCycleScript <instance-group-name> |
| Clé Slurm Munge créée | Clé munge créée et stockée avec succès |
| Validation de la dérive du slurm réussie | Validation de la dérive de la configuration de Slurm réussie |
| Dérive de boue détectée | Dérive de configuration du slurm détectée : <drift-details> |
| La restauration du cluster Slurm est terminée | Échec de la création du cluster : le contrôleur et les nœuds de connexion ne sont pas prêts dans les délais prévus |
| La reconfiguration de Slurm a réussi | Slurm a été reconfiguré avec succès. Configuration de Slurm mise à jour pour correspondre à l'état souhaité |
EventBridge intégration
HyperPod envoie des événements de cluster à Amazon EventBridge en utilisant trois types de détails :
| Type de détail | Description |
|---|---|
SageMaker HyperPod Cluster Event |
Événements opérationnels pour le provisionnement, la mise à l'échelle, l'application de correctifs et les opérations spécifiques à l'orchestrateur. Comprend EventLevel le filtrage de gravité. |
SageMaker HyperPod Cluster State Change |
Cluster-level transitions de statut (par exemple, Création vers InService). Inclut la configuration complète du cluster. |
SageMaker HyperPod Cluster Node Health
Event |
Événements de surveillance de la HyperPod santé émis par l'agent de surveillance de la santé (HMA). Comprend l'état de santé, la raison, les mesures de réparation et les recommandations. |
Exemples de modèles d'événements
Tous les événements HyperPod du cluster :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"] }
Événements d'erreur uniquement (pour les alertes) :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "detail": { "EventDetails": { "EventLevel": ["Error"] } } }
Événements pour un cluster spécifique :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Event"], "resources": ["arn:aws:sagemaker:us-west-2:111122223333:cluster/my-cluster-id"] }
Événements liés à l'état des nœuds :
{ "source": ["aws.sagemaker"], "detail-type": ["SageMaker HyperPod Cluster Node Health Event"] }
Référence des API
-
ListClusterEvents— Répertorier les événements avec filtrage, tri et pagination
-
DescribeClusterEvent— Obtenez tous les détails d'un événement spécifique
-
ClusterEventSummary— Type de données récapitulatif de l'événement
-
ClusterEventDetail— Type de données détaillées de l'événement
Consultez aussi
-
SageMaker HyperPod Événements du cluster Slurm— Événements du cluster Slurm avec utilisation de la CLI et scénarios courants
-
SageMaker HyperPod Événements du cluster EKS— Événements de cluster EKS avec utilisation de la CLI et scénarios courants