Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Häufig gestellte Fragen zum Slurm-Neustart in AWS STCK
Hier finden Sie Antworten auf häufig gestellte Fragen zur Verwendung des Slurm-Neustarts auf PCS. AWS
- Was ist die Unterstützung für Slurm-Neustarts?
-
Unterstützung für den nativen Slurm-Befehl.
scontrol rebootVerwenden Sie diesen Befehl, um Rechenknoten ohne automatischen Instance-Austausch neu zu starten, wodurch die EC2-Instance-Kapazität erhalten bleibt und die Betriebskosten gesenkt werden. - Wer kann Slurm-Reboot-Befehle verwenden?
-
Nur Slurm Admin-Benutzer (Root-Benutzer) können Reboot-Befehle ausführen. Reguläre Benutzer, die versuchen, sie zu verwenden,
scontrol rebooterhalten von Slurm den Fehler „Zugriff verweigert“, ohne dass sich dies auf den Knoten auswirkt. - Was passiert mit laufenden Jobs während eines Neustarts?
-
Standardmäßig werden Jobs normal abgeschlossen, bevor ein Neustart erfolgt. Bei der Option ASAP wird der Knoten entleert, um neue Jobs zu verhindern. Der Neustart erfolgt nach Abschluss der aktuellen Jobs. Jobs können storniert oder für sofortige Neustarts in die Warteschlange gestellt werden.
- Wie unterscheidet sich das vom Neustart der EC2-Konsole?
-
Bei einem Slurm-Neustart bleibt die EC2-Instance erhalten und ein Austausch wird vermieden. Bei einem Neustart der EC2-Konsole ersetzt PCS die Instance aufgrund fehlgeschlagener Integritätsprüfungen während des Neustarts.
- Kann ich benutzerdefinierte Neustartskripte konfigurieren?
-
Nein, die RebootProgram Konfiguration wird in der ersten Version nicht unterstützt. Die Funktion verwendet das standardmäßige Slurm-Neustartverhalten ohne Unterstützung für benutzerdefinierte Skripte.
- Wie lange dauert ein Slurm-Neustart?
-
Die Neustartzeit variiert je nach Instance-Typ, Startprozessen des Kunden, AMI-Konfiguration und ob die Jobs zuerst abgeschlossen werden müssen. Der Prozess umfasst das Warten auf den Abschluss der Jobs, einen physischen Neustart, Zustandsprüfungen und die Registrierung des Slurmd-Daemons.
- Kann ich eine Historie der Neustarts sehen?
-
Neustart-Ereignisse werden in Slurm-Protokollen (slurmctld und slurmd) aufgezeichnet, die überwacht werden können. CloudWatch Das Feld „Grund“ im Knotenstatus zeigt den Grund für den Neustart während des Vorgangs an.
- Was passiert, wenn ein Knoten beim Neustart hängen bleibt?
-
Wenn ein Knoten den internen Neustartvorgang nicht abschließt ResumeTimeout, wird er als DOWN markiert. Überprüfen Sie die CloudWatch Protokolle auf Fehler, überprüfen Sie die Netzwerkkonnektivität und überprüfen Sie die Slurmd-Protokolle. Wenden Sie sich an den AWS Support, falls das Problem weiterhin besteht.
- Kann ich mehrere Knoten gleichzeitig neu starten?
-
Ja, Sie können im Reboot-Befehl mehrere Knoten angeben:
scontrol reboot ASAP node1,node2,node3 - Wie kann ich einen Knoten neu starten, ohne darauf zu warten, dass die Jobs abgeschlossen sind?
-
Bei Problemen wie problematischen Knoten, die Jobs mit mehreren Knoten beeinträchtigen, erhebliche Leistungseinbußen oder instabiles GPU-Verhalten auftreten, haben Sie zwei Möglichkeiten, um Knoten sofort neu zu starten:
-
Abbrechen und neu starten — Stornieren Sie zuerst die betroffenen Jobs mit und starten Sie dann einen sofortigen Neustart mithilfe
scancel <job_id>von.scontrol reboot ASAP <nodename>Laufende Jobs werden beendet und müssen nach der Wiederherstellung des Knotens erneut eingereicht werden. -
Entleeren und neu in die Warteschlange stellen (weniger wirksam) — Initiieren Sie zunächst einen Drainvorgang und führen Sie einen Neustart durch
scontrol reboot ASAP <nodename>, um dann die betroffenen Jobs mithilfe von erneut in die Warteschlange zu stellen.scontrol requeue <job_id>Dadurch werden Jobs wieder in den Status „Ausstehend“ versetzt, anstatt sie zu stornieren.
-
- Was passiert, wenn ich nextState=down angebe?
-
Wenn Sie dies angeben
nextstate=DOWN, wird der Knoten nach dem Neustart und dem Auslösen des Austauschs der Instanz als fehlerhaft markiert. Um zu verhindern, dass eine Instanz ersetzt wird, geben Sie nextstate oder use nicht an.nextstate=RESUME
Weitere Ressourcen
-
Grundlegende Verfahren für Neustarts finden Sie unterStarten Sie einen Rechenknoten mit Slurm in neu AWS 5 STCK.
-
Informationen zur Behebung von Problemen beim Neustart finden Sie unterBehebung von Problemen beim Slurm-Neustart in AWS STCK.
-
Die Dokumentation zum Slurm-Neustart finden Sie in der Slurm scontrol-Dokumentation.