Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Résolution des problèmes liés aux indicateurs de santé des
Les mesures de santé du cluster sont ajoutées au tableau de CloudWatch bord AWS ParallelCluster Amazon à partir de AWS ParallelCluster la version 3.6.0. Dans les sections suivantes, vous découvrirez les indicateurs de santé du tableau de bord et les mesures que vous pouvez prendre pour dépanner et résoudre les problèmes.
Rubriques
En voyant le Erreurs de provisionnement d'instance graphe
Si vous voyez une valeur différente de zéro dans le Instance Provisioning Errors graphique, cela signifie que l'instance Amazon EC2 pour la sauvegarde des nœuds slurm n'a pas pu être lancée sur l'API or. CreateFleet RunInstance
Voyant IAMPolicyErrors
-
Que s'est-il passé ?
Un certain nombre d'instances n'ont pas pu être lancées, en raison d'autorisations insuffisantes et d'un code d'erreur
UnauthorizedOperation. -
Comment résoudre le problème ?
Si vous avez configuré une option InstanceRole ou personnalisée InstanceProfile, vérifiez vos politiques IAM et vérifiez que vous utilisez les informations d'identification correctes.
Consultez le
clustermgtdfichier pour obtenir des informations détaillées sur les erreurs liées aux nœuds statiques. Consultez leslurm_resume.logfichier pour obtenir des informations détaillées sur les erreurs liées aux nœuds dynamiques. Consultez les détails pour en savoir plus sur les autorisations manquantes qui doivent être ajoutées.
Voyant VcpuLimitErrors
-
Que s'est-il passé ?
AWS ParallelCluster n'a pas pu lancer les instances car la limite de processeur virtuel que vous avez définie Compte AWS pour un type d'instance Amazon EC2 spécifique que vous avez configuré pour les nœuds de calcul du cluster a été atteinte.
-
Comment résoudre le problème ?
Recherchez l'
VcpuLimitExceedederreur dans leclustermgtdfichier pour les nœuds statiques et vérifiez dans leslurm_resume.logfichier pour les nœuds dynamiques pour obtenir des informations supplémentaires. Pour résoudre ce problème, vous pouvez demander une augmentation des limites de votre processeur virtuel. Pour plus d'informations sur la façon de consulter les limites actuelles et de demander de nouvelles limites, consultez les quotas de service Amazon Elastic Compute Cloud dans le Guide de l'utilisateur Amazon Elastic Compute Cloud pour les instances Linux.
Voyant VolumeLimitErrors
-
Que s'est-il passé ?
Vous avez atteint la limite de volume Amazon EBS sur votre Compte AWS, et AWS ParallelCluster vous ne parvenez pas à lancer des instances avec un code d'erreur
InsufficientVolumeCapacityouVolumeLimitExceeded. -
Comment résoudre le problème ?
Vérifiez le
clustermgtdfichier pour les nœuds statiques et vérifiez leslurm_resume.logfichier pour les nœuds dynamiques pour obtenir des informations supplémentaires sur les limites de volume. Pour résoudre ce problème, vous pouvez en utiliser un autre Région AWS, nettoyer les volumes existants ou contacter le centre de AWS support pour soumettre une demande visant à augmenter votre limite de volume Amazon EBS.
Voyant InsufficientCapacityErrors
-
Que s'est-il passé ?
AWS ParallelCluster n'a pas la capacité suffisante pour lancer des instances Amazon EC2 sur des nœuds dorsaux.
-
Comment résoudre le problème ?
Vérifiez le
clustermgtdfichier pour les nœuds statiques et vérifiez leslurm_resume.logfichier pour les nœuds dynamiques afin d'obtenir des informations détaillées sur les erreurs de capacité insuffisante. Pour résoudre le problème, suivez les instructions fournies à l'adresse https://aws.amazon.com/premiumsupport/knowledge-center/ec2-insufficient-capacity-errors/.
OtherInstanceLaunchFailures
-
Que s'est-il passé ?
L'instance Amazon EC2 pour la sauvegarde des nœuds de calcul n'a pas pu être lancée avec l'
RunInstanceAPICreateFleetor. -
Comment résoudre le problème ?
Vérifiez le
clustermgtdfichier pour les nœuds statiques et vérifiez leslurm_resume.logfichier pour les nœuds dynamiques pour obtenir les détails des erreurs.
En voyant le Erreurs d'instance défectueuses graphe
-
Que s'est-il passé ?
Un certain nombre d'instances de calcul ont été lancées mais ont été interrompues par la suite en raison de problèmes de santé.
-
Comment résoudre le problème ?
Pour plus d'informations sur la résolution des problèmes liés aux nœuds défectueux, consultezRésolution des problèmes de remplacement et de terminaison inattendus de nœuds.
Voyant InstanceBootstrapTimeoutError
-
Que s'est-il passé ?
Une instance ne peut pas rejoindre le cluster au sein de
resume_timeout(pour les nœuds dynamiques) ounode_replacement_timeout(pour les nœuds statiques). Cela peut se produire si le réseau n'est pas configuré correctement pour les nœuds de calcul ou si les scripts personnalisés exécutés sur le nœud de calcul mettent trop de temps à se terminer. -
Comment résoudre le problème ?
Pour les nœuds dynamiques, consultez le
clustermgtdjournal (/var/log/parallelcluster/clustermgtd) pour l'adresse IP du nœud de calcul et les erreurs telles que les suivantes :Node bootstrap error: Resume timeout expires for nodePour les nœuds statiques, consultez le
clustermgtdjournal (/var/log/parallelcluster/clustermgtd) pour l'adresse IP du nœud de calcul et les erreurs telles que les suivantes :Node bootstrap error: Replacement timeout expires for node ... in replacement.Pour plus de détails, vérifiez que le
/var/log/cloud-init-output.logfichier ne contient pas d'erreurs. Vous pouvez récupérer les adresses IP des nœuds de calcul problématiques à partir des fichiersslurm_resumejournauxclustermgtdet.
Voyant EC2HealthCheckErrors
-
Que s'est-il passé ?
Une instance a échoué à un contrôle de santé Amazon EC2.
-
Comment résoudre le problème ?
Pour plus d'informations sur la façon de résoudre ce problème, voir Résoudre les problèmes liés aux instances dont les contrôles de statut ont échoué.
Voyant ScheduledEventHealthCheckErrors
-
Que s'est-il passé ?
Une instance n'a pas réussi à vérifier l'état d'un événement programmé sur Amazon EC2 et elle est défectueuse.
-
Comment résoudre le problème ?
Pour plus d'informations sur la façon de résoudre ce problème, consultez la section Événements planifiés pour vos instances.
Voyant NoCorrespondingInstanceErrors
-
Que s'est-il passé ?
AWS ParallelCluster Impossible de trouver des instances supportant des nœuds. Les nœuds se sont probablement arrêtés automatiquement pendant les opérations d'amorçage. SlurmQueues/CustomActions/OnNodeStart| des erreurs de OnNodeConfigured script ou de réseau peuvent se produire
NoCorrespondingInstanceErrors. -
Comment résoudre le problème ?
Pour plus de détails, vérifiez
/var/log/cloud-init-output.logle nœud de calcul.
En voyant le Temps d'inactivité de la flotte informatique graphe
En voyant un MaxDynamicNodeIdleTime qui est nettement plus long que Réduire le temps d'inactivité seuil
-
Que s'est-il passé ?
Votre instance ne se termine pas correctement.
MaxDynamicNodeIdleTimeindique la durée maximale en secondes pendant laquelle un nœud dynamique, soutenu par une instance Amazon EC2, est inactif. Le seuil Idle Time Scaledown est dérivé du paramètre de configuration ScaledownIdletime du cluster. Lorsqu'un nœud de calcul est inactif depuis plus de quelques secondes, Slurm il met le nœud hors tension et AWS ParallelCluster met fin à l'instance de sauvegarde. Dans ce cas, quelque chose empêche la fermeture de l'instance. -
Comment résoudre le problème ?
Pour plus d'informations sur ce problème, voir Remplacement, arrêt ou mise hors tension des instances et des nœuds problématiques dansRésolution des problèmes de dimensionnement.