Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Behebung von Problemen beim Slurm-Neustart in AWS STCK
Wenn Probleme beim Neustarten des Knotens auftreten, überprüfen Sie zunächst den Knotenstatus mitscontrol
show node . Untersuchen Sie dann die CloudWatch Protokolle sowohl für Slurm (slurmctld und slurmd) als auch für Systemprotokolle, um mögliche Fehler zu identifizieren.nodename
Überprüfen Sie zur grundlegenden Problembehandlung die Netzwerkkonnektivität, überprüfen Sie die Sicherheitsgruppeneinstellungen und stellen Sie sicher, dass alle erforderlichen Dienste nach dem Neustart ausgeführt werden. Wenn die Probleme nach den grundlegenden Schritten zur Fehlerbehebung weiterhin bestehen, wenden Sie sich an den AWS Support. Wenn Sie sich an den Support wenden, geben Sie relevante Protokollauszüge, Informationen zum Knotenstatus und einen Zeitplan für den Neustartversuch an, um den Problemlösungsprozess zu beschleunigen.
Weitere Ressourcen
-
Informationen zur Überwachung von AWS PCS-Instances mithilfe von CloudWatch Amazon finden Sie unter Überwachen von AWS PCS-Instances mithilfe von Amazon. CloudWatch
-
Allgemeine Informationen zur Problembehandlung finden Sie unterBehebung von Problemen in AWS Dienst für parallele Datenverarbeitung.
-
Die Slurm-Dokumentation finden Sie im Slurm-Leitfaden zur Fehlerbehebung.