Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Résolution des problèmes de redémarrage de Slurm dans AWS PIÈCES
Lorsque vous rencontrez des problèmes de redémarrage d'un nœud, vérifiez d'abord l'état du nœud à l'aide descontrol
show node . Examinez ensuite les CloudWatch journaux de Slurm (slurmctld et slurmd) et les journaux système afin d'identifier les erreurs potentielles.nodename
Pour résoudre les problèmes de base, vérifiez la connectivité réseau, vérifiez les paramètres du groupe de sécurité et assurez-vous que tous les services requis sont en cours d'exécution après le redémarrage. Si les problèmes persistent après les étapes de dépannage de base, contactez AWS le support. Lorsque vous contactez l'assistance, fournissez des extraits de journal pertinents, des informations sur l'état du nœud et un calendrier de la tentative de redémarrage afin d'accélérer le processus de résolution.
Ressources supplémentaires
-
Pour surveiller les instances AWS PCS à l'aide de CloudWatch, voir Surveillance des instances AWS PCS à l'aide d'Amazon CloudWatch.
-
Pour obtenir des informations générales sur la résolution des problèmes, consultezRésolution des problèmes dans AWS Service de calcul parallèle.
-
Pour consulter la documentation de Slurm, consultez le Guide de dépannage de Slurm.