View a markdown version of this page

Es wird versucht, einen Cluster zu erstellen - AWS ParallelCluster
FailureCode ist OnNodeConfiguredExecutionFailureFailureCode ist OnNodeConfiguredDownloadFailureFailureCode ist OnNodeConfiguredFailureFailureCode ist OnNodeStartExecutionFailureFailureCode ist OnNodeStartDownloadFailureFailureCode ist OnNodeStartFailureFailureCode ist EbsMountFailureFailureCode ist EfsMountFailureFailureCode ist FsxMountFailureFailureCode ist RaidMountFailureFailureCode ist AmiVersionMismatchFailureCode ist InvalidAmiFailureCode hat den Wert HeadNodeBootstrapFailure FailureReason Failed to set the head node.Bei FailureCode wurde das HeadNodeBootstrapFailure Zeitlimit für die Clustererstellung überschritten.FailureCode ist HeadNodeBootstrapFailure mit FailureReason Der Bootstrap des Headknotens ist fehlgeschlagen.FailureCode ist ResourceCreationFailureFailureCode ist ClusterCreationFailureDie WaitCondition Anzeige ist abgelaufen...im CloudFormation StapelIch sehe, dass die Erstellung der Ressource im CloudFormation Stapel abgebrochen wurdeEs wird angezeigt CFN-Init konnte nicht ausgeführt werden...oder andere Fehler in der CloudFormation StackWenn chef-client.log angezeigt wird, endet das Wort INFO: Es wird auf die Bereitstellung der statischen Flottenkapazität gewartetIn cfn-init.log wird angezeigt, dass die Vor- oder Nachinstallation nicht ausgeführt werden konnteSeeing This AMI wurde mit xxx erstellt, versucht aber, mit xxx verwendet zu werden...im CloudFormation StapelDieses AMI zu sehen, wurde nicht unterstützt AWS ParallelCluster...im CloudFormation StapelWenn der Befehl pcluster create-cluster angezeigt wird, kann er nicht lokal ausgeführt werdenZusätzlicher Support

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Es wird versucht, einen Cluster zu erstellen

Wenn Sie AWS ParallelCluster Version 3.5.0 und höher zum Erstellen eines Clusters verwenden und eine Clustererstellung mit --rollback-on-failure set to fehlgeschlagen istfalse, verwenden Sie den pcluster describe-cluster CLI-Befehl, um Status- und Fehlerinformationen abzurufen. In diesem Fall ist CREATE_FAILED der erwartete clusterStatus Wert der pcluster describe-cluster Ausgabe. Überprüfen Sie den failures Abschnitt in der Ausgabe, um das failureCode und zu findenfailureReason. Suchen Sie dann im folgenden Abschnitt nach dem passenden ArtikelfailureCode, um weitere Hilfe bei der Problembehandlung zu erhalten. Weitere Informationen finden Sie unter pcluster describe-cluster.

In den folgenden Abschnitten empfehlen wir Ihnen, die Protokolle auf dem Hauptknoten zu überprüfen, z. B. die /var/log/cfn-init.log /var/log/chef-client.log UND-Dateien. Weitere Informationen zu AWS ParallelCluster Protokollen und deren Anzeige finden Sie unter Wichtige Protokolle für das Debuggen undProtokolle abrufen und aufbewahren.

Wenn Sie keine habenfailureCode, navigieren Sie zur CloudFormation Konsole, um den Cluster-Stack anzuzeigen. Suchen Sie im Status Reason Feld nach HeadNodeWaitCondition oder Fehlern in anderen Ressourcen, um weitere Fehlerdetails zu finden. Weitere Informationen finden Sie unter Anzeigen CloudFormation Ereignisse auf CREATE_FAILED. Überprüfen Sie die /var/log/chef-client.log Dateien /var/log/cfn-init.log und auf dem Hauptknoten. Wenn die Clustererstellung aufgrund eines Fehlers bei der Erstellung des Hauptknotens fehlschlägt und die Clusterprotokolle nicht in der Cluster-Protokollgruppe verfügbar sind, müssen Sie den Cluster bei einem Ausfall beibehalten, --rollback-on-failure = angeben True und die Protokolle aus dem Hauptknoten selbst abrufen.

FailureCode ist OnNodeConfiguredExecutionFailure

  • Warum ist es gescheitert?

    Sie haben in OnNodeConfigured der Konfiguration ein benutzerdefiniertes Skript im Abschnitt Head Node bereitgestellt, um einen Cluster zu erstellen. Das benutzerdefinierte Skript konnte jedoch nicht ausgeführt werden.

  • Wie kann ich das Problem lösen?

    In der /var/log/cfn-init.log Datei erfahren Sie mehr über den Fehler und wie Sie das Problem in Ihrem benutzerdefinierten Skript beheben können. Gegen Ende dieses Protokolls werden nach der Running command runpostinstall Meldung möglicherweise Informationen zur Ausführung des OnNodeConfigured Skripts angezeigt.

FailureCode ist OnNodeConfiguredDownloadFailure

  • Warum ist es gescheitert?

    Sie haben in OnNodeConfigured der Konfiguration ein benutzerdefiniertes Skript im Abschnitt Head Node bereitgestellt, um einen Cluster zu erstellen. Das benutzerdefinierte Skript konnte jedoch nicht heruntergeladen werden.

  • Wie kann ich das Problem lösen?

    Stellen Sie sicher, dass die URL gültig ist und dass der Zugriff korrekt konfiguriert ist. Weitere Informationen zur Konfiguration von benutzerdefinierten Bootstrap-Skripten finden Sie unterBenutzerdefinierte Bootstrap-Aktionen.

    Prüfen Sie die /var/log/cfn-init.log Datei. Am Ende dieses Protokolls finden Sie nach der Running command runpostinstall Meldung möglicherweise Ausführungsinformationen zur OnNodeConfigured Skriptverarbeitung, einschließlich des Herunterladens.

FailureCode ist OnNodeConfiguredFailure

  • Warum ist es gescheitert?

    Sie haben in OnNodeConfigured der Konfiguration ein benutzerdefiniertes Skript im Abschnitt Head Node bereitgestellt, um einen Cluster zu erstellen. Die Verwendung des benutzerdefinierten Skripts schlug jedoch bei der Cluster-Bereitstellung fehl. Eine unmittelbare Ursache kann nicht ermittelt werden, und es sind weitere Untersuchungen erforderlich.

  • Wie kann ich das Problem lösen?

    Überprüfe die /var/log/cfn-init.log Datei. Gegen Ende dieses Protokolls werden nach der Running command runpostinstall Meldung möglicherweise Ausführungsinformationen zur OnNodeConfigured Skriptverarbeitung angezeigt.

FailureCode ist OnNodeStartExecutionFailure

  • Warum ist es gescheitert?

    Sie haben in OnNodeStart der Konfiguration ein benutzerdefiniertes Skript im Abschnitt Head Node bereitgestellt, um einen Cluster zu erstellen. Das benutzerdefinierte Skript konnte jedoch nicht ausgeführt werden.

  • Wie kann ich das Problem lösen?

    In der /var/log/cfn-init.log Datei erfahren Sie mehr über den Fehler und wie Sie das Problem in Ihrem benutzerdefinierten Skript beheben können. Gegen Ende dieses Protokolls werden nach der Running command runpreinstall Meldung möglicherweise Informationen zur Ausführung des OnNodeStart Skripts angezeigt.

FailureCode ist OnNodeStartDownloadFailure

  • Warum ist es gescheitert?

    Sie haben in OnNodeStart der Konfiguration ein benutzerdefiniertes Skript im Abschnitt Head Node bereitgestellt, um einen Cluster zu erstellen. Das benutzerdefinierte Skript konnte jedoch nicht heruntergeladen werden.

  • Wie kann ich das Problem lösen?

    Stellen Sie sicher, dass die URL gültig ist und dass der Zugriff korrekt konfiguriert ist. Weitere Informationen zur Konfiguration von benutzerdefinierten Bootstrap-Skripten finden Sie unterBenutzerdefinierte Bootstrap-Aktionen.

    Prüfen Sie die /var/log/cfn-init.log Datei. Am Ende dieses Protokolls finden Sie nach der Running command runpreinstall Meldung möglicherweise Ausführungsinformationen zur OnNodeStart Skriptverarbeitung, einschließlich des Herunterladens.

FailureCode ist OnNodeStartFailure

  • Warum ist es gescheitert?

    Sie haben in der Konfiguration ein benutzerdefiniertes Skript im Abschnitt OnNodeStart des Kopfknotens bereitgestellt, um einen Cluster zu erstellen. Die Verwendung des benutzerdefinierten Skripts schlug jedoch bei der Cluster-Bereitstellung fehl. Eine unmittelbare Ursache kann nicht ermittelt werden, und es sind weitere Untersuchungen erforderlich.

  • Wie kann ich das Problem lösen?

    Überprüfe die /var/log/cfn-init.log Datei. Gegen Ende dieses Protokolls werden nach der Running command runpreinstall Meldung möglicherweise Ausführungsinformationen zur OnNodeStart Skriptverarbeitung angezeigt.

FailureCode ist EbsMountFailure

  • Warum ist es gescheitert?

    Das in der Clusterkonfiguration definierte EBS-Volume konnte nicht gemountet werden.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die /var/log/chef-client.log Datei auf Fehlerdetails.

FailureCode ist EfsMountFailure

  • Warum ist es gescheitert?

    Das in der Cluster-Konfiguration definierte Amazon EFS-Volume konnte nicht gemountet werden.

  • Wie kann ich das Problem lösen?

    Wenn Sie ein vorhandenes Amazon EFS-Dateisystem definiert haben, stellen Sie sicher, dass der Datenverkehr zwischen dem Cluster und dem Dateisystem zulässig ist. Weitere Informationen finden Sie unter SharedStorage/EfsSettings/FileSystemId.

    Überprüfen Sie die /var/log/chef-client.log Datei auf Fehlerdetails.

FailureCode ist FsxMountFailure

  • Warum ist es gescheitert?

    Das in der Cluster-Konfiguration definierte Amazon FSx-Dateisystem konnte nicht gemountet werden.

  • Wie kann ich das Problem lösen?

    Wenn Sie ein vorhandenes Amazon FSx-Dateisystem definiert haben, stellen Sie sicher, dass der Datenverkehr zwischen dem Cluster und dem Dateisystem zulässig ist. Weitere Informationen finden Sie unter SharedStorage/FsxLustreSettings/FileSystemId.

    Überprüfen Sie die /var/log/chef-client.log Datei auf Fehlerdetails.

FailureCode ist RaidMountFailure

  • Warum ist es gescheitert?

    Die in der Clusterkonfiguration definierten RAID-Volumes konnten nicht gemountet werden.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die /var/log/chef-client.log Datei auf Fehlerdetails.

FailureCode ist AmiVersionMismatch

  • Warum ist es gescheitert?

    Die AWS ParallelCluster Version, die zum Erstellen des benutzerdefinierten AMI verwendet wird, unterscheidet sich von der AWS ParallelCluster Version, die für die Konfiguration des Clusters verwendet wurde. Sehen Sie sich in der CloudFormation Konsole die CloudFormation Cluster-Stack-Details an und suchen Sie HeadNodeWaitCondition nach dem, um weitere Informationen zu den AWS ParallelCluster Versionen und dem AMI zu erhalten. Status Reason Weitere Informationen finden Sie unter Anzeigen CloudFormation Ereignisse auf CREATE_FAILED.

  • Wie kann ich das Problem lösen?

    Stellen Sie sicher, dass die AWS ParallelCluster Version, die zum Erstellen des benutzerdefinierten AMI verwendet wird, dieselbe AWS ParallelCluster Version ist, die für die Konfiguration des Clusters verwendet wurde. Sie können entweder die benutzerdefinierte AMI-Version oder die pcluster CLI-Version ändern, um sie identisch zu machen.

FailureCode ist InvalidAmi

  • Warum ist es gescheitert?

    Das benutzerdefinierte AMI ist ungültig, da es nicht mit erstellt wurde AWS ParallelCluster.

  • Wie kann ich das Problem lösen?

    Verwenden Sie den pcluster build-image Befehl, um ein AMI zu erstellen, indem Sie Ihr AMI zum übergeordneten Image machen. Weitere Informationen finden Sie unter pcluster build-image.

FailureCode hat den Wert HeadNodeBootstrapFailure FailureReason Failed to set the head node.

  • Warum ist es gescheitert?

    Eine unmittelbare Ursache kann nicht ermittelt werden und es sind weitere Untersuchungen erforderlich. Es könnte beispielsweise sein, dass sich der Cluster im Status „Geschützt“ befindet, und dies könnte durch einen Fehler bei der Bereitstellung der statischen Rechenflotte verursacht werden.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die /var/log/chef-client.log. Datei auf Fehlerdetails.

    Anmerkung

    Wenn Sie eine RuntimeError Ausnahme sehenCluster state has been set to PROTECTED mode due to failures detected in static node provisioning, befindet sich der Cluster im Status „Geschützt“. Weitere Informationen finden Sie unter Wie debuggt man den geschützten Modus.

Bei FailureCode wurde das HeadNodeBootstrapFailure Zeitlimit für die Clustererstellung überschritten.

  • Warum ist es fehlgeschlagen?

    Standardmäßig gibt es ein Zeitlimit von 30 Minuten, bis die Clustererstellung abgeschlossen ist. Wenn die Clustererstellung nicht innerhalb dieses Zeitrahmens abgeschlossen wurde, schlägt die Clustererstellung mit einem Timeout-Fehler fehl. Bei der Clustererstellung kann es aus verschiedenen Gründen zu einem Timeout kommen. Timeout-Fehler können beispielsweise durch einen Fehler bei der Erstellung eines Hauptknotens, ein Netzwerkproblem, benutzerdefinierte Skripts, deren Ausführung im Hauptknoten zu lange dauert, einen Fehler in einem benutzerdefinierten Skript, das auf Rechenknoten ausgeführt wird, oder durch lange Wartezeiten für die Bereitstellung von Rechenknoten verursacht werden. Eine unmittelbare Ursache kann nicht ermittelt werden und es sind weitere Untersuchungen erforderlich.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die /var/log/cfn-init.log und /var/log/chef-client.log -Dateien auf Fehlerdetails. Weitere Informationen zu AWS ParallelCluster Protokollen und wie Sie sie abrufen können, finden Sie unter Wichtige Protokolle für das Debuggen undProtokolle abrufen und aufbewahren.

    In diesen Protokollen finden Sie möglicherweise Folgendes.

    • Ich Waiting for static fleet capacity provisioning sehe gegen Ende des chef-client.log

      Dies weist darauf hin, dass bei der Clustererstellung ein Timeout aufgetreten ist, als auf das Hochfahren statischer Knoten gewartet wurde. Weitere Informationen finden Sie unter Es werden Fehler bei der Initialisierung von Rechenknoten angezeigt.

    • Das Skript zum OnNodeStart Anzeigen OnNodeConfigured oder Aufrufen des Knotens ist am Ende des cfn-init.log

      Dies weist darauf hin, dass die Ausführung des OnNodeConfigured oder OnNodeStart benutzerdefinierten Skripts lange gedauert hat und einen Timeout-Fehler verursacht hat. Überprüfen Sie Ihr benutzerdefiniertes Skript auf Probleme, die dazu führen könnten, dass es über einen längeren Zeitraum ausgeführt wird. Wenn die Ausführung Ihres benutzerdefinierten Skripts eine lange Zeit benötigt, sollten Sie erwägen, das Timeout-Limit zu ändern, indem Sie Ihrer Cluster-Konfigurationsdatei einen DevSettings Abschnitt hinzufügen, wie im folgenden Beispiel gezeigt:

      DevSettings: Timeouts: HeadNodeBootstrapTimeout: 2100 # default setting: 2100 seconds
    • Die Protokolle können nicht gefunden werden, oder der Hauptknoten wurde nicht erfolgreich erstellt

      Es ist möglich, dass der Hauptknoten nicht erfolgreich erstellt wurde und die Protokolle nicht gefunden werden können. In diesem Fall können Sie zusätzliche Fehlerdetails abrufen, indem Sie die CloudFormation Stack-Ereignisse und das Headnode-Konsolenprotokoll überprüfen. Sie können das Head-Node-Konsolenprotokoll über die Amazon EC2-Konsole abrufen oder indem Sie den folgenden Amazon EC2-CLI-Befehl ausführen:

      aws ec2 get-console-output --instance-id HEAD_NODE_INSTANCE_ID --output text

FailureCode ist HeadNodeBootstrapFailure mit FailureReason Der Bootstrap des Headknotens ist fehlgeschlagen.

  • Warum ist es fehlgeschlagen?

    Eine unmittelbare Ursache kann nicht ermittelt werden und es sind weitere Untersuchungen erforderlich.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die /var/log/cfn-init.log und /var/log/chef-client.log -Dateien.

FailureCode ist ResourceCreationFailure

  • Warum ist es gescheitert?

    Die Erstellung einiger Ressourcen ist während der Clustererstellung fehlgeschlagen. Der Fehler kann aus verschiedenen Gründen auftreten. Fehler beim Erstellen von Ressourcen können beispielsweise durch Kapazitätsprobleme oder eine falsch konfigurierte IAM-Richtlinie verursacht werden.

  • Wie kann ich das Problem lösen?

    Sehen Sie sich in der CloudFormation Konsole den Cluster-Stack an, um nach weiteren Details zu Fehlern bei der Ressourcenerstellung zu suchen.

FailureCode ist ClusterCreationFailure

  • Warum ist es gescheitert?

    Eine unmittelbare Ursache kann nicht ermittelt werden und es sind weitere Untersuchungen erforderlich.

  • Wie kann ich das Problem lösen?

    Sehen Sie sich in der CloudFormation Konsole den Cluster-Stack an und suchen Sie HeadNodeWaitCondition nach dem, um weitere Fehlerdetails zu finden. Status Reason

    Überprüfen Sie die /var/log/chef-client.log Dateien /var/log/cfn-init.log und.

Die WaitCondition Anzeige ist abgelaufen...im CloudFormation Stapel

Weitere Informationen finden Sie unter Bei FailureCode wurde das HeadNodeBootstrapFailure Zeitlimit für die Clustererstellung überschritten..

Ich sehe, dass die Erstellung der Ressource im CloudFormation Stapel abgebrochen wurde

Weitere Informationen finden Sie unter FailureCode ist ResourceCreationFailure.

Es wird angezeigt CFN-Init konnte nicht ausgeführt werden...oder andere Fehler in der CloudFormation Stack

Weitere Fehlerdetails finden Sie unter /var/log/cfn-init.log und/var/log/chef-client.log.

Wenn chef-client.log angezeigt wird, endet das Wort INFO: Es wird auf die Bereitstellung der statischen Flottenkapazität gewartet

Dies hängt mit dem Timeout bei der Clustererstellung zusammen, wenn darauf gewartet wird, dass statische Knoten hochgefahren werden. Weitere Informationen finden Sie unter Es werden Fehler bei der Initialisierung von Rechenknoten angezeigt.

In cfn-init.log wird angezeigt, dass die Vor- oder Nachinstallation nicht ausgeführt werden konnte

Sie haben ein OnNodeConfigured OnNodeStart OR-Skript im Abschnitt zur Cluster-KonfigurationHeadNode. Das Skript funktioniert nicht richtig. Überprüfen Sie die /var/log/cfn-init.log Datei auf benutzerdefinierte Skriptfehlerdetails.

Seeing This AMI wurde mit xxx erstellt, versucht aber, mit xxx verwendet zu werden...im CloudFormation Stapel

Weitere Informationen finden Sie unter FailureCode ist AmiVersionMismatch.

Dieses AMI zu sehen, wurde nicht unterstützt AWS ParallelCluster...im CloudFormation Stapel

Weitere Informationen finden Sie unter FailureCode ist InvalidAmi.

Wenn der Befehl pcluster create-cluster angezeigt wird, kann er nicht lokal ausgeführt werden

Überprüfen Sie das ~/.parallelcluster/pcluster-cli.log in Ihrem lokalen Dateisystem auf Fehlerdetails.

Zusätzlicher Support

Folgen Sie den Anleitungen zur Fehlerbehebung unterBehebung von Problemen bei der Cluster-Bereitstellung.

Prüfen Sie unter Bekannte Probleme, ob Ihr Szenario unter GitHub Bekannte Probleme behandelt wird GitHub. AWS ParallelCluster