Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Vérifications de surveillance approfondie de l’état
SageMaker HyperPod effectue des contrôles de santé approfondis sur les instances de Slurm-orchestrated cluster afin de garantir la fiabilité et la stabilité du matériel et de l'infrastructure sous-jacents. Des contrôles d'état approfondis peuvent être exécutés automatiquement lorsque des instances sont créées ou ajoutées à un cluster (au démarrage), ou vous pouvez les déclencher manuellement à tout moment (à la demande) à l'aide de l'StartClusterHealthCheckAPI. Cette approche proactive permet d'identifier et d'atténuer les problèmes potentiels tout au long du cycle de vie du cluster.
Lors de contrôles de santé approfondis, les nœuds concernés sont placés dans une réservation de maintenance Slurm afin d'empêcher la planification de tâches sur ceux-ci. Une fois toutes les vérifications effectuées, les nœuds sont libérés de la réservation et deviennent disponibles pour les charges de travail.
Important
Pour utiliser des contrôles de santé approfondis, vous devez installer la dernière version de l'AMI. Exécutez UpdateClusterSoftware pour effectuer la mise à jour vers la dernière version de l'AMI. Si vous utilisez une ancienne version d'AMI, les contrôles d'état approfondis risquent de ne pas fonctionner comme prévu.
Types de bilans de santé approfondis
SageMaker HyperPod prend en charge deux catégories de contrôles de santé approfondis pour les clusters Slurm :
-
InstanceStress— Exécute des tests au niveau de l'instance, notamment des tests de résistance du matériel (processeur, mémoire, disque, GPU/PCI vérification), des diagnostics du GPU DCGM et la connectivité de bouclage EFA. Cela permet de valider l'état de santé du matériel de chaque nœud.
-
InstanceConnectivity— Exécute des tests NCCL (NVIDIA Collective Communications Library) au niveau du cluster sur plusieurs nœuds afin de vérifier les performances de communication entre les GPU. Cette vérification n'est prise en charge que sur les instances dotées de capacités de communication GPU multi-nœuds.
Liste des bilans de santé approfondis effectués par SageMaker HyperPod
SageMaker HyperPod exécute les contrôles de santé approfondis suivants.
Instance-level bilans de santé approfondis (InstanceStress)
| Catégorie | Nom de l’utilitaire | Compatibilité des types d’instance | Description |
|---|---|---|---|
| Accélérateur | GPU/NVLink nombre | GPU | Vérifie les GPU/NVLink comptes. |
| Accélérateur | Diagnostic DCGM |
GPU | Évalue l’intégrité et les fonctionnalités des GPU NVIDIA en exécutant des tests de diagnostic DCGM (NVIDIA Data Center GPU Manager) de niveau 4, y compris des tests de mémoire supplémentaires. Durée typique : 45 à 90 minutes selon le nombre de processeurs graphiques. |
| Réseau | EFA | GPU | Exécute des tests de bande passante et de latence de bouclage EFA sur le périphérique EFA connecté. Durée typique : environ 2 à 5 minutes. |
Cluster-level bilans de santé approfondis (InstanceConnectivity)
| Catégorie | Nom de l’utilitaire | Compatibilité des types d’instance | Description |
|---|---|---|---|
| Accélérateur | Test NCCL | GPU | Exécute des tests de all_reduce performance NCCL sur plusieurs nœuds pour vérifier la bande passante de communication entre les GPU. Durée typique : ~5 à 15 minutes selon le nombre de nœuds. |
On-start bilans de santé approfondis
On-start des contrôles de santé approfondis s'exécutent automatiquement lors du premier provisionnement des instances, lors de la création du cluster ou lorsque de nouvelles instances sont ajoutées via UpdateCluster. Cela garantit que chaque nœud passe la validation matérielle avant d'accepter les charges de travail.
Activation de contrôles de santé approfondis dès le démarrage
Pour activer les contrôles de santé approfondis au démarrage, spécifiez le OnStartDeepHealthChecks paramètre dans la configuration du groupe d'instances lors de la création ou de la mise à jour d'un cluster.
Exemple : création d'un cluster avec des contrôles de santé approfondis au démarrage
aws sagemaker create-cluster \ --cluster-namemy-slurm-cluster\ --instance-groups '[ { "InstanceGroupName": "controller-group", "InstanceType": "ml.m5.xlarge", "InstanceCount": 1, "LifeCycleConfig": { "SourceS3Uri": "s3://my-bucket/lifecycle-scripts/", "OnCreate": "on_create.sh" }, "ExecutionRole": "arn:aws:iam::111122223333:role/my-role", "ThreadsPerCore": 1 }, { "InstanceGroupName": "worker-group", "InstanceType": "ml.p4d.24xlarge", "InstanceCount": 4, "LifeCycleConfig": { "SourceS3Uri": "s3://my-bucket/lifecycle-scripts/", "OnCreate": "on_create.sh" }, "ExecutionRole": "arn:aws:iam::111122223333:role/my-role", "ThreadsPerCore": 1, "OnStartDeepHealthChecks": ["InstanceStress", "InstanceConnectivity"] } ]' \ --vpc-config '{"SecurityGroupIds":["sg-12345678"],"Subnets":["subnet-12345678"]}'
Que se passe-t-il lors des bilans de santé approfondis au démarrage
Lorsque les contrôles de santé approfondis au démarrage sont activés, le processus suivant se produit :
-
Approvisionnement des nœuds : de nouvelles instances sont lancées et des scripts de cycle de vie s'exécutent.
-
Isolation des nœuds : l'agent de HyperPod cluster place de nouveaux nœuds dans une réservation de maintenance Slurm (
hyperpod-deep-health-check) et les ajoute à lahyperpod-system-maintenancepartition. Les nœuds sont marqués avec la fonction Slurm.SageMakerDeepHealthCheck:InProgressCela empêche la planification de tâches sur ces nœuds pendant les tests. -
Exécution des tests : les tests suivants sont exécutés sur chaque nœud dans le cadre de la
InstanceStressvérification :-
HARDWARE_CHECK : fonctionne
stress-ngpour les tests de résistance du processeur, de la mémoire et du disque, suivis de la vérification du nombre de périphériques GPU et PCI. Durée typique : ~1 à 2 minutes. -
DCGM : exécute les diagnostics NVIDIA DCGM au niveau 4, y compris les tests de mémoire du GPU. Durée typique : 45 à 90 minutes selon le nombre de processeurs graphiques.
-
EFA : exécute des tests de bande passante et de latence de bouclage EFA. Durée typique : environ 2 à 5 minutes.
Si cette option
InstanceConnectivityest également activée, le test supplémentaire suivant est exécuté :-
NCCL : exécute des tests de
all_reduceperformance NCCL sur plusieurs nœuds pour vérifier la bande passante de communication entre les GPU. Durée typique : ~5 à 15 minutes selon le nombre de nœuds.
-
-
Gestion des résultats :
-
Réussite : le nœud est supprimé de la réservation de maintenance, la fonction de vérification approfondie de l'état est désactivée et le nœud devient disponible pour des tâches sur la partition qui lui a été attribuée.
-
Échec : le nœud reste isolé. SageMaker HyperPod remplace automatiquement le nœud défaillant et effectue des contrôles d'état approfondis sur le nœud de remplacement.
-
Le cluster passe à InService une fois qu'au moins le nœud contrôleur est en cours d'exécution. Les nœuds de travail affichent DeepHealthCheckInProgress leur état pendant les tests et passent à une version Running après la réussite.
Surveillance des bilans de santé approfondis au démarrage
Vous pouvez surveiller l'état des contrôles de santé approfondis au démarrage à l'aide de l'API Amazon SageMaker AI ou des commandes Slurm.
Vérifiez l'état du nœud à l'aide du AWS Command Line Interface
aws sagemaker list-cluster-nodes \ --cluster-namemy-slurm-cluster
Les nœuds soumis à des contrôles de santé approfondis s'affichent InstanceStatus.Status sous la formeDeepHealthCheckInProgress.
Vérifiez l'état de Slurm via SSM sur le nœud du contrôleur
# View node states sinfo -a -N -l # View maintenance reservation scontrol show reservations # View running DHC jobs squeue -a
Les nœuds soumis à un contrôle de santé approfondi apparaissent dans la hyperpod-deep-health-check réservation et dans la hyperpod-system-maintenance partition.
Ajout de nœuds à un cluster avec des contrôles de santé approfondis au démarrage activés
Lorsque vous agrandissez un cluster déjà OnStartDeepHealthChecks configuré, les nouveaux nœuds sont automatiquement soumis à des contrôles de santé approfondis avant d'accepter des charges de travail. Les nœuds existants et les tâches en cours d'exécution ne sont pas affectés.
aws sagemaker update-cluster \ --cluster-namemy-slurm-cluster\ --instance-groups '[ { "InstanceGroupName": "controller-group", "InstanceType": "ml.m5.xlarge", "InstanceCount": 1, "LifeCycleConfig": { "SourceS3Uri": "s3://my-bucket/lifecycle-scripts/", "OnCreate": "on_create.sh" }, "ExecutionRole": "arn:aws:iam::111122223333:role/my-role", "ThreadsPerCore": 1 }, { "InstanceGroupName": "worker-group", "InstanceType": "ml.p4d.24xlarge", "InstanceCount": 8, "LifeCycleConfig": { "SourceS3Uri": "s3://my-bucket/lifecycle-scripts/", "OnCreate": "on_create.sh" }, "ExecutionRole": "arn:aws:iam::111122223333:role/my-role", "ThreadsPerCore": 1, "OnStartDeepHealthChecks": ["InstanceStress", "InstanceConnectivity"] } ]'
Les nouveaux nœuds sont isolés dans la réserve de maintenance pendant que des contrôles d'état approfondis sont effectués. Les tâches qui nécessitent la capacité supplémentaire des nouveaux nœuds attendent que ces nœuds passent des contrôles d'état approfondis et soient disponibles. Les tâches qui peuvent être satisfaites par les nœuds disponibles existants ne sont pas affectées.
On-demand bilans de santé approfondis
On-demand des contrôles d'état approfondis vous permettent de déclencher la validation matérielle sur les nœuds de cluster existants à tout moment à l'aide de l'StartClusterHealthCheckAPI. Ceci est utile pour la validation périodique de l'état de santé ou en cas de suspicion de problèmes matériels.
Exécution de bilans de santé approfondis à la demande depuis la console
Vous pouvez effectuer des contrôles de santé approfondis sur les instances de HyperPod cluster directement depuis la console SageMaker AI.
Pour exécuter des bilans de santé approfondis à la demande depuis la console
-
Ouvrez la console SageMaker AI sur SageMaker AI console
. -
Dans le volet de navigation, sous HyperPod, choisissez Clusters.
-
Choisissez le nom de votre cluster pour ouvrir la page détaillée du cluster.
-
Dans le tableau Instances, sélectionnez une ou plusieurs instances sur lesquelles vous souhaitez effectuer des contrôles de santé approfondis.
Note
Les familles d'instances prises en charge incluent g5, p4 et p5. Non-accelerated les instances sont automatiquement ignorées.
-
Choisissez Actions, puis choisissez Exécuter des bilans de santé approfondis.
-
Sélectionnez Contrôle de stress, Contrôle de connectivité, ou les deux :
-
Contrôle de résistance — Valide le matériel de l'accélérateur sous charge (correspond à
InstanceStress). -
Contrôle de connectivité : valide la communication réseau entre les nœuds (correspond à
InstanceConnectivity).
-
-
Choisissez Exécuter des bilans de santé.
Une bannière de réussite confirme que les contrôles ont été initiés. Les instances ne sont pas disponibles pour les charges de travail pendant les vérifications, qui peuvent prendre plus d'une heure. Surveillez l'état de l'instance dans le tableau Instances : il indique un contrôle de santé approfondi en cours d'exécution. Lorsque des problèmes sont détectés et que la restauration automatique est activée, redémarre ou remplace SageMaker HyperPod automatiquement les instances défectueuses.
Déclencher des bilans de santé approfondis à la demande AWS Command Line Interface
Vous pouvez spécifier les groupes d'instances et les vérifications à exécuter. Une seule demande de bilan de santé approfondi à la demande peut être active par cluster à la fois.
aws sagemaker start-cluster-health-check \ --cluster-namemy-slurm-cluster\ --deep-health-check-configurations '[ { "InstanceGroupName": "worker-group", "DeepHealthChecks": ["InstanceStress", "InstanceConnectivity"] } ]'
Comportement lors de l'exécution de charges de travail
Lorsque des contrôles d'état approfondis à la demande sont déclenchés sur des nœuds qui exécutent des tâches :
-
Les tâches en cours ne sont ni interrompues ni interrompues.
-
Le bilan de santé approfondi est en file d'attente et attend la fin de la tâche en cours. Si la tâche en cours n'est pas terminée dans les 10 minutes, le nœud est ignoré du bilan de santé approfondi.
-
Les nœuds sont placés dans la réserve de maintenance pour empêcher la planification de nouvelles tâches pendant les tests.
Journaux issus des vérifications de surveillance approfondie de l’état
Voici des exemples de journaux issus des contrôles de santé SageMaker HyperPod approfondis.
Cluster-level journaux
Les journaux de contrôle de santé approfondis au niveau du cluster sont stockés dans votre groupe de journaux à l'adresse CloudWatch . /aws/sagemaker/Clusters/<cluster_name>/<cluster_id>
Les flux de journaux sont consignés dans DeepHealthCheckResults/<log_stream_id>.
Instance-level journaux
Sur chaque nœud, les journaux de contrôle de santé approfondis sont stockés dans/var/log/aws/clusters/sagemaker-deep-health-check.log.
Vous pouvez accéder au journal via SSM :
aws ssm start-session \ --target "sagemaker-cluster:<cluster_id>_<instance_group>-<instance_id>"
Consultez ensuite le journal :
cat /var/log/aws/clusters/sagemaker-deep-health-check.log
Exemple de sortie HARDWARE_CHECK
2026-03-29T18:03:14Z info Executing Hardware stress check with command: stress-ng 2026-03-29T18:04:20Z info stress-ng success 2026-03-29T18:04:20Z info GpuPci Count check success
Exemple de sortie DCGM
2026-03-29T18:35:02Z info DCGM diagnostic health summary: dcgmCheckLevel: 4 dcgmVersion: 3.3.7 gpuDriverVersion: 535.183.01 gpuDeviceIds: [2237] replacementRequired: false rebootRequired: false
Exemple de sortie EFA
2026-03-29T18:36:28Z info EFA Loopback check passed for device: rdmap0s29 MaxBw: 58.59, AvgBw: 32.42, MaxTypicalLat: 30.87, AvgLat: 21.63
Exemple de résultat d'échec d'un bilan de santé approfondi
{ "level": "error", "ts": "2026-03-29T19:15:22Z", "msg": "Encountered FaultyInstance. Replace the Instance. Region: us-west-2, InstanceType: ml.g5.8xlarge. ERROR: Bandwidth has less than threshold: Expected minimum threshold: 80, NCCL Test output Bw: 30" }
Auto-resume comportement avec des bilans de santé approfondis
Si les contrôles d'état approfondis ne sont pas activés, lorsqu'un nœud est remplacé pendant la reprise automatique, le nœud de remplacement est immédiatement ajouté au cluster et la tâche reprise automatiquement peut être planifiée sur celui-ci immédiatement.
Lorsque les contrôles de santé approfondis sont activés, le nœud de remplacement doit réussir tous les tests de santé approfondis configurés avant d'être disponible. Cependant, la tâche reprise automatiquement n'a pas besoin d'attendre le nœud de remplacement : elle peut être planifiée sur n'importe quel autre nœud disponible du cluster. La tâche n'est en attente que si aucun autre nœud n'est disponible.
Considérations supplémentaires
-
Les contrôles de santé approfondis nécessitent la dernière version de l'AMI. Exécutez UpdateClusterSoftware pour mettre à jour votre cluster avant d'activer des contrôles de santé approfondis.
-
Des contrôles de santé approfondis ne sont exécutés que sur les nœuds de travail. Les nœuds de contrôleur et de connexion ne sont pas soumis à des contrôles de santé approfondis.
-
Une seule demande de bilan de santé approfondi à la demande peut être active par cluster à la fois.
-
Si une vérification à la demande déclenche le redémarrage ou le remplacement d'un nœud, le nœud de remplacement n'effectue des contrôles d'état approfondis que s'
OnStartDeepHealthChecksil est activé sur le groupe d'instances. Dans le cas contraire, le nœud se reconnecte sans effectuer de nouveaux contrôles de santé approfondis.