View a markdown version of this page

Essayer de créer un cluster - AWS ParallelCluster
FailureCode est OnNodeConfiguredExecutionFailureFailureCode est OnNodeConfiguredDownloadFailureFailureCode est OnNodeConfiguredFailureFailureCode est OnNodeStartExecutionFailureFailureCode est OnNodeStartDownloadFailureFailureCode est OnNodeStartFailureFailureCode est EbsMountFailureFailureCode est EfsMountFailureFailureCode est FsxMountFailureFailureCode est RaidMountFailureFailureCode est AmiVersionMismatchFailureCode est InvalidAmiFailureCode correspond HeadNodeBootstrapFailure à FailureReason Failed pour configurer le nœud principal.Le délai de création du cluster FailureCode a HeadNodeBootstrapFailure expiré avec FailureReason.FailureCode indique que HeadNodeBootstrapFailure FailureReason a échoué à démarrer le nœud principal.FailureCode est ResourceCreationFailureFailureCode est ClusterCreationFailureLe temps de WaitCondition visionnage a expiré...en CloudFormation pileVoir la création de ressources annulée dans la CloudFormation pileAffichage de l'échec de l'exécution de cfn-init...ou d'autres erreurs dans CloudFormation pileLe fichier chef-client.log se termine par INFO : En attente du provisionnement statique de la capacité de la flotteAffichage de l'échec de l'exécution de la préinstallation ou de la post-installation dans le fichier cfn-init.logVoir que cette AMI a été créée avec xxx, mais essaie d'être utilisée avec xxx...en CloudFormation pileSeeing This AMI n'a pas été créé par AWS ParallelCluster...en CloudFormation pileVoir que la commande pcluster create-cluster ne s'exécute pas localementSupport supplémentaire

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Essayer de créer un cluster

Lorsque vous utilisez AWS ParallelCluster la version 3.5.0 et les versions ultérieures pour créer un cluster et que la création d'un cluster a échoué avec --rollback-on-failure set tofalse, utilisez la commande pcluster describe-cluster CLI pour obtenir des informations sur l'état et les défaillances. Dans ce cas, clusterStatus la pcluster describe-cluster sortie attendue estCREATE_FAILED. Consultez la failures section de la sortie pour trouver le failureCode etfailureReason. Ensuite, dans la section suivante, recherchez la solution correspondante failureCode pour obtenir de l'aide supplémentaire au dépannage. Pour de plus amples informations, veuillez consulter pcluster describe-cluster.

Dans les sections suivantes, nous vous recommandons de consulter les journaux du nœud principal, tels que les /var/log/chef-client.log fichiers /var/log/cfn-init.log et. Pour plus d'informations sur AWS ParallelCluster les journaux et la manière de les consulter, consultez Journaux clés pour le débogage etRécupération et conservation des journaux.

Si vous n'en avez pasfailureCode, accédez à la CloudFormation console pour afficher la pile de clusters. Vérifiez la présence Status Reason de défaillances HeadNodeWaitCondition ou de défaillances dans d'autres ressources pour obtenir des informations supplémentaires sur les défaillances. Pour de plus amples informations, veuillez consulter Afficher CloudFormation événements sur CREATE_FAILED. Vérifiez les /var/log/chef-client.log fichiers /var/log/cfn-init.log et sur le nœud principal. Si la création du cluster échoue en raison de l'échec de la création du nœud principal et que les journaux du cluster ne sont pas disponibles dans le groupe de journaux du cluster, vous devez conserver le cluster en cas d'échec, spécifier --rollback-on-failure = True et récupérer les journaux depuis le nœud principal lui-même.

FailureCode est OnNodeConfiguredExecutionFailure

  • Pourquoi a-t-il échoué ?

    Vous avez fourni un script personnalisé dans OnNodeConfigured la section nœud principal de la configuration pour créer un cluster. Cependant, le script personnalisé n'a pas pu être exécuté.

  • Comment résoudre le problème ?

    Consultez le /var/log/cfn-init.log fichier pour en savoir plus sur l'échec et sur la manière de le résoudre dans votre script personnalisé. À la fin de ce journal, vous pouvez voir des informations d'exécution relatives au OnNodeConfigured script après le Running command runpostinstall message.

FailureCode est OnNodeConfiguredDownloadFailure

  • Pourquoi a-t-il échoué ?

    Vous avez fourni un script personnalisé dans OnNodeConfigured la section nœud principal de la configuration pour créer un cluster. Cependant, le script personnalisé n'a pas pu être téléchargé.

  • Comment résoudre le problème ?

    Assurez-vous que l'URL est valide et que l'accès est correctement configuré. Pour plus d'informations sur la configuration des scripts d'amorçage personnalisés, consultezActions de bootstrap personnalisées.

    Vérifiez le /var/log/cfn-init.log dossier. À la fin de ce journal, vous pouvez voir des informations d'exécution relatives au traitement des OnNodeConfigured scripts, y compris le téléchargement, après le Running command runpostinstall message.

FailureCode est OnNodeConfiguredFailure

  • Pourquoi a-t-il échoué ?

    Vous avez fourni un script personnalisé dans OnNodeConfigured la section nœud principal de la configuration pour créer un cluster. Cependant, l'utilisation du script personnalisé a échoué lors du déploiement du cluster. Aucune cause immédiate ne peut être déterminée et une enquête supplémentaire est nécessaire.

  • Comment résoudre le problème ?

    Vérifiez le /var/log/cfn-init.log dossier. À la fin de ce journal, vous pouvez voir des informations d'exécution relatives au traitement des OnNodeConfigured scripts après le Running command runpostinstall message.

FailureCode est OnNodeStartExecutionFailure

  • Pourquoi a-t-il échoué ?

    Vous avez fourni un script personnalisé dans OnNodeStart la section nœud principal de la configuration pour créer un cluster. Cependant, le script personnalisé n'a pas pu être exécuté.

  • Comment résoudre le problème ?

    Consultez le /var/log/cfn-init.log fichier pour en savoir plus sur l'échec et sur la manière de le résoudre dans votre script personnalisé. À la fin de ce journal, vous pouvez voir des informations d'exécution relatives au OnNodeStart script après le Running command runpreinstall message.

FailureCode est OnNodeStartDownloadFailure

  • Pourquoi a-t-il échoué ?

    Vous avez fourni un script personnalisé dans OnNodeStart la section nœud principal de la configuration pour créer un cluster. Cependant, le script personnalisé n'a pas pu être téléchargé.

  • Comment résoudre le problème ?

    Assurez-vous que l'URL est valide et que l'accès est correctement configuré. Pour plus d'informations sur la configuration des scripts d'amorçage personnalisés, consultezActions de bootstrap personnalisées.

    Vérifiez le /var/log/cfn-init.log dossier. À la fin de ce journal, vous pouvez voir des informations d'exécution relatives au traitement des OnNodeStart scripts, y compris le téléchargement, après le Running command runpreinstall message.

FailureCode est OnNodeStartFailure

  • Pourquoi a-t-il échoué ?

    Vous avez fourni un script personnalisé dans la OnNodeStart section du nœud principal de la configuration pour créer un cluster. Cependant, l'utilisation du script personnalisé a échoué lors du déploiement du cluster. Aucune cause immédiate ne peut être déterminée et une enquête supplémentaire est nécessaire.

  • Comment résoudre le problème ?

    Vérifiez le /var/log/cfn-init.log dossier. À la fin de ce journal, vous pouvez voir des informations d'exécution relatives au traitement des OnNodeStart scripts après le Running command runpreinstall message.

FailureCode est EbsMountFailure

  • Pourquoi a-t-il échoué ?

    Le volume EBS défini dans la configuration du cluster n'a pas pu être monté.

  • Comment résoudre le problème ?

    Consultez le /var/log/chef-client.log fichier pour plus de détails sur les défaillances.

FailureCode est EfsMountFailure

  • Pourquoi a-t-il échoué ?

    Le volume Amazon EFS défini dans la configuration du cluster n'a pas pu être monté.

  • Comment résoudre le problème ?

    Si vous avez défini un système de fichiers Amazon EFS existant, assurez-vous que le trafic est autorisé entre le cluster et le système de fichiers. Pour plus d'informations, voir SharedStorage/EfsSettings/FileSystemId.

    Consultez le /var/log/chef-client.log fichier pour plus de détails sur les défaillances.

FailureCode est FsxMountFailure

  • Pourquoi a-t-il échoué ?

    Le système de fichiers Amazon FSx défini dans la configuration du cluster n'a pas pu être monté.

  • Comment résoudre le problème ?

    Si vous avez défini un système de fichiers Amazon FSx existant, assurez-vous que le trafic est autorisé entre le cluster et le système de fichiers. Pour plus d'informations, voir SharedStorage/FsxLustreSettings/FileSystemId.

    Consultez le /var/log/chef-client.log fichier pour plus de détails sur les défaillances.

FailureCode est RaidMountFailure

  • Pourquoi a-t-il échoué ?

    Les volumes RAID définis dans la configuration du cluster n'ont pas pu être montés.

  • Comment résoudre le problème ?

    Consultez le /var/log/chef-client.log fichier pour plus de détails sur les défaillances.

FailureCode est AmiVersionMismatch

  • Pourquoi a-t-il échoué ?

    La AWS ParallelCluster version utilisée pour créer l'AMI personnalisée est différente de la AWS ParallelCluster version utilisée pour configurer le cluster. Dans la CloudFormation console, consultez les détails de la CloudFormation pile de clusters et cochez la case Status Reason HeadNodeWaitCondition pour obtenir des informations supplémentaires sur les AWS ParallelCluster versions et l'AMI. Pour de plus amples informations, veuillez consulter Afficher CloudFormation événements sur CREATE_FAILED.

  • Comment résoudre le problème ?

    Assurez-vous que la AWS ParallelCluster version utilisée pour créer l'AMI personnalisée est la même que celle AWS ParallelCluster utilisée pour configurer le cluster. Vous pouvez modifier la version personnalisée de l'AMI ou la version de la pcluster CLI pour les rendre identiques.

FailureCode est InvalidAmi

  • Pourquoi a-t-il échoué ?

    L'AMI personnalisée n'est pas valide car elle n'a pas été créée à l'aide de AWS ParallelCluster.

  • Comment résoudre le problème ?

    Utilisez la pcluster build-image commande pour créer une AMI en faisant de votre AMI l'image parente. Pour de plus amples informations, veuillez consulter image de construction de pcluster.

FailureCode correspond HeadNodeBootstrapFailure à FailureReason Failed pour configurer le nœud principal.

  • Pourquoi est-ce que ça a échoué ?

    Aucune cause immédiate ne peut être déterminée et une enquête supplémentaire est nécessaire. Par exemple, il se peut que le cluster soit en état protégé, ce qui peut être dû à un échec de provisionnement de la flotte de calcul statique.

  • Comment résoudre le problème ?

    Consultez le /var/log/chef-client.log. fichier pour plus de détails sur les défaillances.

    Note

    Si vous voyez RuntimeError une exceptionCluster state has been set to PROTECTED mode due to failures detected in static node provisioning, cela signifie que le cluster est en statut protégé. Pour de plus amples informations, veuillez consulter Comment déboguer le mode protégé.

Le délai de création du cluster FailureCode a HeadNodeBootstrapFailure expiré avec FailureReason.

  • Pourquoi est-ce que ça a échoué ?

    Par défaut, la durée de création du cluster est limitée à 30 minutes. Si la création du cluster n'est pas terminée dans ce délai, la création du cluster échoue avec une erreur de temporisation. La création du cluster peut expirer pour différentes raisons. Par exemple, les échecs de temporisation peuvent être causés par un échec de création du nœud de tête, un problème de réseau, des scripts personnalisés qui prennent trop de temps à s'exécuter dans le nœud de tête, une erreur dans un script personnalisé qui s'exécute dans les nœuds de calcul ou de longs délais d'attente pour le provisionnement des nœuds de calcul. Aucune cause immédiate ne peut être déterminée et une enquête supplémentaire est nécessaire.

  • Comment résoudre le problème ?

    Consultez les /var/log/chef-client.log fichiers /var/log/cfn-init.log et pour plus de détails sur les défaillances. Pour plus d'informations sur AWS ParallelCluster les journaux et sur la manière de les obtenir, consultez Journaux clés pour le débogage etRécupération et conservation des journaux.

    Vous découvrirez peut-être les informations suivantes dans ces journaux.

    • Vue Waiting for static fleet capacity provisioning vers la fin du chef-client.log

      Cela indique que le délai de création du cluster a expiré en attendant la mise sous tension des nœuds statiques. Pour de plus amples informations, veuillez consulter Affichage d'erreurs dans les initialisations des nœuds de calcul.

    • Le script de OnNodeStart visualisation OnNodeConfigured ou de tête n'est pas terminé à la fin du cfn-init.log

      Cela indique que le script OnNodeConfigured ou le script OnNodeStart personnalisé a mis du temps à s'exécuter et a provoqué une erreur de temporisation. Vérifiez si votre script personnalisé ne présente pas de problèmes susceptibles de l'entraîner à s'exécuter pendant une longue période. Si l'exécution de votre script personnalisé est longue, pensez à modifier le délai d'expiration en ajoutant une DevSettings section au fichier de configuration de votre cluster, comme illustré dans l'exemple suivant :

      DevSettings: Timeouts: HeadNodeBootstrapTimeout: 2100 # default setting: 2100 seconds
    • Impossible de trouver les journaux ou le nœud principal n'a pas été créé correctement

      Il est possible que le nœud principal n'ait pas été créé correctement et que les journaux soient introuvables. Dans ce cas, vous pouvez obtenir des informations supplémentaires sur les défaillances en consultant les événements de la CloudFormation pile et le journal de la console du nœud principal. Vous pouvez récupérer le journal de la console du nœud principal via la console Amazon EC2 ou en exécutant la commande CLI Amazon EC2 suivante :

      aws ec2 get-console-output --instance-id HEAD_NODE_INSTANCE_ID --output text

FailureCode indique que HeadNodeBootstrapFailure FailureReason a échoué à démarrer le nœud principal.

  • Pourquoi est-ce que ça a échoué ?

    Aucune cause immédiate ne peut être déterminée et une enquête supplémentaire est nécessaire.

  • Comment résoudre le problème ?

    Vérifiez les /var/log/chef-client.log fichiers /var/log/cfn-init.log et.

FailureCode est ResourceCreationFailure

  • Pourquoi a-t-il échoué ?

    La création de certaines ressources a échoué pendant le processus de création du cluster. L'échec peut survenir pour diverses raisons. Par exemple, les échecs de création de ressources peuvent être dus à des problèmes de capacité ou à une politique IAM mal configurée.

  • Comment résoudre le problème ?

    Dans la CloudFormation console, consultez la pile de clusters pour rechercher des informations supplémentaires sur l'échec de création de ressources.

FailureCode est ClusterCreationFailure

  • Pourquoi a-t-il échoué ?

    Aucune cause immédiate ne peut être déterminée et une enquête supplémentaire est nécessaire.

  • Comment résoudre le problème ?

    Dans la CloudFormation console, visualisez la pile de clusters et cochez la case Status Reason pour HeadNodeWaitCondition obtenir des informations supplémentaires sur les défaillances.

    Vérifiez les /var/log/chef-client.log fichiers /var/log/cfn-init.log et.

Le temps de WaitCondition visionnage a expiré...en CloudFormation pile

Pour de plus amples informations, veuillez consulter Le délai de création du cluster FailureCode a HeadNodeBootstrapFailure expiré avec FailureReason..

Voir la création de ressources annulée dans la CloudFormation pile

Pour de plus amples informations, veuillez consulter FailureCode est ResourceCreationFailure.

Affichage de l'échec de l'exécution de cfn-init...ou d'autres erreurs dans CloudFormation pile

Consultez le /var/log/cfn-init.log et /var/log/chef-client.log pour plus de détails sur les défaillances.

Le fichier chef-client.log se termine par INFO : En attente du provisionnement statique de la capacité de la flotte

Ceci est lié au délai de création du cluster lors de l'attente de la mise sous tension des nœuds statiques. Pour de plus amples informations, veuillez consulter Affichage d'erreurs dans les initialisations des nœuds de calcul.

Affichage de l'échec de l'exécution de la préinstallation ou de la post-installation dans le fichier cfn-init.log

Vous disposez d'un OnNodeStart script OnNodeConfigured ou dans la HeadNode section de configuration du cluster. Le script ne fonctionne pas correctement. Consultez le /var/log/cfn-init.log fichier pour obtenir des informations détaillées sur les erreurs de script personnalisées.

Voir que cette AMI a été créée avec xxx, mais essaie d'être utilisée avec xxx...en CloudFormation pile

Pour de plus amples informations, veuillez consulter FailureCode est AmiVersionMismatch.

Seeing This AMI n'a pas été créé par AWS ParallelCluster...en CloudFormation pile

Pour de plus amples informations, veuillez consulter FailureCode est InvalidAmi.

Voir que la commande pcluster create-cluster ne s'exécute pas localement

Vérifiez les informations ~/.parallelcluster/pcluster-cli.log relatives à la défaillance dans votre système de fichiers local.

Support supplémentaire

Suivez les instructions de dépannage figurant dansRésolution des problèmes de déploiement de clusters.

Vérifiez si votre scénario est couvert dans la section Problèmes GitHub connus à AWS ParallelCluster la fin GitHub.