View a markdown version of this page

Fehlerbehebung bei Cluster-Integritätsmetriken - AWS ParallelCluster

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Fehlerbehebung bei Cluster-Integritätsmetriken

Cluster-Integritätsmetriken werden dem AWS ParallelCluster CloudWatch Amazon-Dashboard ab AWS ParallelCluster Version 3.6.0 hinzugefügt. In den folgenden Abschnitten erfahren Sie mehr über die Integritätskennzahlen des Dashboards sowie über Maßnahmen, die Sie zur Behebung und Behebung von Problemen ergreifen können.

Ich sehe die Fehler bei der Instanzbereitstellung Diagramm

Wenn Sie in der Instance Provisioning Errors Grafik einen Wert ungleich Null sehen, bedeutet das, dass die Amazon EC2-Instance zur Unterstützung von Slurm-Knoten auf der OR-API nicht gestartet werden konnte. CreateFleet RunInstance

Sehen IAMPolicyErrors

  • Was ist passiert?

    Eine Reihe von Instances konnte nicht gestartet werden, was auf unzureichende Berechtigungen mit Fehlercode zurückzuführen istUnauthorizedOperation.

  • Wie kann ich das Problem lösen?

    Wenn Sie ein benutzerdefiniertes InstanceRole oder konfiguriert haben InstanceProfile, überprüfen Sie Ihre IAM-Richtlinien und stellen Sie sicher, dass Sie die richtigen Anmeldeinformationen verwenden.

    Überprüfen Sie die clustermgtd Datei auf Fehlerdetails für statische Knoten. Überprüfen Sie die slurm_resume.log Datei auf dynamische Knotenfehlerdetails. Verwenden Sie die Details, um mehr über die fehlenden Berechtigungen zu erfahren, die hinzugefügt werden müssen.

Sehen VcpuLimitErrors

  • Was ist passiert?

    AWS ParallelCluster konnte Instances nicht starten, da das vCPU-Limit auf Ihrem AWS-Konto für einen bestimmten Amazon EC2-Instance-Typ, den Sie für Cluster-Rechenknoten konfiguriert haben, erreicht wurde.

  • Wie kann ich das Problem lösen?

    Suchen Sie nach dem VcpuLimitExceeded Fehler in der clustermgtd Datei für statische Knoten, und überprüfen Sie die slurm_resume.log Datei für dynamische Knoten, um weitere Details zu erhalten. Um dieses Problem zu beheben, können Sie eine Erhöhung Ihrer vCPU-Limits beantragen. Weitere Informationen darüber, wie Sie aktuelle Limits einsehen und neue Limits anfordern können, finden Sie unter Amazon Elastic Compute Cloud-Servicekontingente im Amazon Elastic Compute Cloud-Benutzerhandbuch für Linux-Instances.

Sehen VolumeLimitErrors

  • Was ist passiert?

    Sie haben Ihr Amazon EBS-Volumenlimit für Ihr AWS-Konto erreicht und AWS ParallelCluster können Instances mit dem Fehlercode InsufficientVolumeCapacity oder VolumeLimitExceeded nicht starten.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die clustermgtd Datei auf statische Knoten und überprüfen Sie die slurm_resume.log Datei auf dynamische Knoten, um zusätzliche Details zur Volumenbegrenzung zu erhalten. Um dieses Problem zu lösen, können Sie ein anderes verwenden AWS-Region, vorhandene Volumes bereinigen oder sich an das AWS Support Center wenden, um eine Anfrage zur Erhöhung Ihres Amazon EBS-Volumenlimits einzureichen.

Sehen InsufficientCapacityErrors

OtherInstanceLaunchFailures

  • Was ist passiert?

    Die Amazon EC2-Instance zur Sicherung von Rechenknoten konnte nicht mit der CreateFleet RunInstance OR-API gestartet werden.

  • Wie kann ich das Problem lösen?

    Überprüfen Sie die clustermgtd Datei auf statische Knoten und überprüfen Sie die slurm_resume.log Datei auf dynamische Knoten, um Fehlerdetails zu erhalten.

Ich sehe die Ungesunde Instance-Fehler Diagramm

  • Was ist passiert?

    Eine Reihe von Recheninstanzen wurde gestartet, aber später als fehlerhaft beendet.

  • Wie kann ich das Problem lösen?

    Weitere Hinweise zur Problembehandlung bei fehlerhaften Knoten finden Sie unterBehebung unerwarteter Knotenwechsel und -beendigungen.

Sehen InstanceBootstrapTimeoutError

  • Was ist passiert?

    Eine Instanz kann dem Cluster innerhalb der resume_timeout (für dynamische Knoten) oder node_replacement_timeout (für statische Knoten) nicht beitreten. Dies kann passieren, wenn das Netzwerk für die Rechenknoten nicht richtig konfiguriert ist, oder es kann vorkommen, dass benutzerdefinierte Skripts, die auf dem Rechenknoten ausgeführt werden, zu lange brauchen, bis sie fertig sind.

  • Wie kann ich das Problem lösen?

    Bei dynamischen Knoten überprüfen Sie das clustermgtd Log (/var/log/parallelcluster/clustermgtd) auf die IP-Adresse des Rechenknotens und auf Fehler wie die folgenden:

    Node bootstrap error: Resume timeout expires for node

    Bei statischen Knoten überprüfen Sie das clustermgtd Log (/var/log/parallelcluster/clustermgtd) auf die IP-Adresse des Rechenknotens und auf Fehler wie die folgenden:

    Node bootstrap error: Replacement timeout expires for node ... in replacement.

    Weitere Informationen finden Sie in der /var/log/cloud-init-output.log Datei auf Fehler. Sie können problematische IP-Adressen von Rechenknoten aus den clustermgtd und slurm_resume -Protokolldateien abrufen.

Sehen EC2HealthCheckErrors

Sehen ScheduledEventHealthCheckErrors

  • Was ist passiert?

    Eine Instance hat einen in Amazon EC2 geplanten Event-Health Check nicht bestanden und ist fehlerhaft.

  • Wie kann ich das Problem lösen?

    Informationen zur Behebung dieses Problems finden Sie unter Geplante Ereignisse für Ihre Instances.

Sehen NoCorrespondingInstanceErrors

  • Was ist passiert?

    AWS ParallelCluster kann keine Instanzen finden, die Knoten unterstützen. Die Knoten haben sich während der Bootstrap-Operationen wahrscheinlich selbst beendet. SlurmQueues/CustomActions/OnNodeStart| OnNodeConfigured Skript- oder Netzwerkfehler können dazu führen. NoCorrespondingInstanceErrors

  • Wie kann ich das Problem lösen?

    Weitere Informationen finden Sie unter /var/log/cloud-init-output.log für den Rechenknoten.

Ich sehe den Die Leerlaufzeit der Flotte berechnen Diagramm

Einen zu sehen MaxDynamicNodeIdleTime, der deutlich länger ist als der Leerlaufzeit: Herunterskalieren threshold

  • Was ist passiert?

    Ihre Instance wird nicht ordnungsgemäß beendet. MaxDynamicNodeIdleTimezeigt die maximale Zeit in Sekunden an, während der ein dynamischer Knoten, der von einer Amazon EC2-Instance unterstützt wird, inaktiv ist. Der Schwellenwert für die Skalierung der Leerlaufzeit wird aus dem Cluster-Konfigurationsparameter abgeleitet. ScaledownIdletime Wenn ein Rechenknoten länger als Idle Time Scaledown Sekunden inaktiv war, Slurm wird der Knoten heruntergefahren und die Backing-Instance AWS ParallelCluster beendet. In diesem Fall verhindert etwas die Beendigung der Instanz.

  • Wie kann ich das Problem lösen?

    Weitere Informationen zu diesem Problem finden Sie Ersetzen, Beenden oder Ausschalten problematischer Instanzen und Knoten unterBehebung von Skalierungsproblemen.