Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Fehlerbehebung bei Cluster-Integritätsmetriken
Cluster-Integritätsmetriken werden dem AWS ParallelCluster CloudWatch Amazon-Dashboard ab AWS ParallelCluster Version 3.6.0 hinzugefügt. In den folgenden Abschnitten erfahren Sie mehr über die Integritätskennzahlen des Dashboards sowie über Maßnahmen, die Sie zur Behebung und Behebung von Problemen ergreifen können.
Themen
Ich sehe die Fehler bei der Instanzbereitstellung Diagramm
Wenn Sie in der Instance Provisioning Errors Grafik einen Wert ungleich Null sehen, bedeutet das, dass die Amazon EC2-Instance zur Unterstützung von Slurm-Knoten auf der OR-API nicht gestartet werden konnte. CreateFleet RunInstance
Sehen IAMPolicyErrors
-
Was ist passiert?
Eine Reihe von Instances konnte nicht gestartet werden, was auf unzureichende Berechtigungen mit Fehlercode zurückzuführen ist
UnauthorizedOperation. -
Wie kann ich das Problem lösen?
Wenn Sie ein benutzerdefiniertes InstanceRole oder konfiguriert haben InstanceProfile, überprüfen Sie Ihre IAM-Richtlinien und stellen Sie sicher, dass Sie die richtigen Anmeldeinformationen verwenden.
Überprüfen Sie die
clustermgtdDatei auf Fehlerdetails für statische Knoten. Überprüfen Sie dieslurm_resume.logDatei auf dynamische Knotenfehlerdetails. Verwenden Sie die Details, um mehr über die fehlenden Berechtigungen zu erfahren, die hinzugefügt werden müssen.
Sehen VcpuLimitErrors
-
Was ist passiert?
AWS ParallelCluster konnte Instances nicht starten, da das vCPU-Limit auf Ihrem AWS-Konto für einen bestimmten Amazon EC2-Instance-Typ, den Sie für Cluster-Rechenknoten konfiguriert haben, erreicht wurde.
-
Wie kann ich das Problem lösen?
Suchen Sie nach dem
VcpuLimitExceededFehler in derclustermgtdDatei für statische Knoten, und überprüfen Sie dieslurm_resume.logDatei für dynamische Knoten, um weitere Details zu erhalten. Um dieses Problem zu beheben, können Sie eine Erhöhung Ihrer vCPU-Limits beantragen. Weitere Informationen darüber, wie Sie aktuelle Limits einsehen und neue Limits anfordern können, finden Sie unter Amazon Elastic Compute Cloud-Servicekontingente im Amazon Elastic Compute Cloud-Benutzerhandbuch für Linux-Instances.
Sehen VolumeLimitErrors
-
Was ist passiert?
Sie haben Ihr Amazon EBS-Volumenlimit für Ihr AWS-Konto erreicht und AWS ParallelCluster können Instances mit dem Fehlercode
InsufficientVolumeCapacityoderVolumeLimitExceedednicht starten. -
Wie kann ich das Problem lösen?
Überprüfen Sie die
clustermgtdDatei auf statische Knoten und überprüfen Sie dieslurm_resume.logDatei auf dynamische Knoten, um zusätzliche Details zur Volumenbegrenzung zu erhalten. Um dieses Problem zu lösen, können Sie ein anderes verwenden AWS-Region, vorhandene Volumes bereinigen oder sich an das AWS Support Center wenden, um eine Anfrage zur Erhöhung Ihres Amazon EBS-Volumenlimits einzureichen.
Sehen InsufficientCapacityErrors
-
Was ist passiert?
AWS ParallelCluster hat nicht genügend Kapazität, um Amazon EC2-Instances auf Back-Nodes zu starten.
-
Wie kann ich das Problem lösen?
Überprüfen Sie die
clustermgtdDatei auf statische Knoten und überprüfen Sie dieslurm_resume.logDatei auf dynamische Knoten, um Fehlerdetails zu unzureichender Kapazität zu erhalten. Um das Problem zu beheben, folgen Sie den Anweisungen unter https://aws.amazon.com/premiumsupport/knowledge-center/ec2-insufficient-capacity-errors/.
OtherInstanceLaunchFailures
-
Was ist passiert?
Die Amazon EC2-Instance zur Sicherung von Rechenknoten konnte nicht mit der
CreateFleetRunInstanceOR-API gestartet werden. -
Wie kann ich das Problem lösen?
Überprüfen Sie die
clustermgtdDatei auf statische Knoten und überprüfen Sie dieslurm_resume.logDatei auf dynamische Knoten, um Fehlerdetails zu erhalten.
Ich sehe die Ungesunde Instance-Fehler Diagramm
-
Was ist passiert?
Eine Reihe von Recheninstanzen wurde gestartet, aber später als fehlerhaft beendet.
-
Wie kann ich das Problem lösen?
Weitere Hinweise zur Problembehandlung bei fehlerhaften Knoten finden Sie unterBehebung unerwarteter Knotenwechsel und -beendigungen.
Sehen InstanceBootstrapTimeoutError
-
Was ist passiert?
Eine Instanz kann dem Cluster innerhalb der
resume_timeout(für dynamische Knoten) odernode_replacement_timeout(für statische Knoten) nicht beitreten. Dies kann passieren, wenn das Netzwerk für die Rechenknoten nicht richtig konfiguriert ist, oder es kann vorkommen, dass benutzerdefinierte Skripts, die auf dem Rechenknoten ausgeführt werden, zu lange brauchen, bis sie fertig sind. -
Wie kann ich das Problem lösen?
Bei dynamischen Knoten überprüfen Sie das
clustermgtdLog (/var/log/parallelcluster/clustermgtd) auf die IP-Adresse des Rechenknotens und auf Fehler wie die folgenden:Node bootstrap error: Resume timeout expires for nodeBei statischen Knoten überprüfen Sie das
clustermgtdLog (/var/log/parallelcluster/clustermgtd) auf die IP-Adresse des Rechenknotens und auf Fehler wie die folgenden:Node bootstrap error: Replacement timeout expires for node ... in replacement.Weitere Informationen finden Sie in der
/var/log/cloud-init-output.logDatei auf Fehler. Sie können problematische IP-Adressen von Rechenknoten aus denclustermgtdundslurm_resume-Protokolldateien abrufen.
Sehen EC2HealthCheckErrors
-
Was ist passiert?
Eine Instance hat eine Amazon EC2-Zustandsprüfung nicht bestanden.
-
Wie kann ich das Problem lösen?
Informationen zur Behebung dieses Problems finden Sie unter Problembehandlung bei Instanzen mit fehlgeschlagenen Statusprüfungen.
Sehen ScheduledEventHealthCheckErrors
-
Was ist passiert?
Eine Instance hat einen in Amazon EC2 geplanten Event-Health Check nicht bestanden und ist fehlerhaft.
-
Wie kann ich das Problem lösen?
Informationen zur Behebung dieses Problems finden Sie unter Geplante Ereignisse für Ihre Instances.
Sehen NoCorrespondingInstanceErrors
-
Was ist passiert?
AWS ParallelCluster kann keine Instanzen finden, die Knoten unterstützen. Die Knoten haben sich während der Bootstrap-Operationen wahrscheinlich selbst beendet. SlurmQueues/CustomActions/OnNodeStart| OnNodeConfigured Skript- oder Netzwerkfehler können dazu führen.
NoCorrespondingInstanceErrors -
Wie kann ich das Problem lösen?
Weitere Informationen finden Sie unter
/var/log/cloud-init-output.logfür den Rechenknoten.
Ich sehe den Die Leerlaufzeit der Flotte berechnen Diagramm
Einen zu sehen MaxDynamicNodeIdleTime, der deutlich länger ist als der Leerlaufzeit: Herunterskalieren threshold
-
Was ist passiert?
Ihre Instance wird nicht ordnungsgemäß beendet.
MaxDynamicNodeIdleTimezeigt die maximale Zeit in Sekunden an, während der ein dynamischer Knoten, der von einer Amazon EC2-Instance unterstützt wird, inaktiv ist. Der Schwellenwert für die Skalierung der Leerlaufzeit wird aus dem Cluster-Konfigurationsparameter abgeleitet. ScaledownIdletime Wenn ein Rechenknoten länger als Idle Time Scaledown Sekunden inaktiv war, Slurm wird der Knoten heruntergefahren und die Backing-Instance AWS ParallelCluster beendet. In diesem Fall verhindert etwas die Beendigung der Instanz. -
Wie kann ich das Problem lösen?
Weitere Informationen zu diesem Problem finden Sie Ersetzen, Beenden oder Ausschalten problematischer Instanzen und Knoten unterBehebung von Skalierungsproblemen.