Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Starten Sie einen Rechenknoten mit Slurm in neu AWS 5 STCK
Verwenden Sie den nativen Reboot-Befehl von Slurm, um Leistungsprobleme zu lösen, Ressourcenprobleme zu beheben oder sich aus einem heruntergekommenen Zustand ohne Verlust der EC2-Instance-Kapazität zu erholen.
Voraussetzungen
-
Slurm Admin-Rechte (Root-Benutzerzugriff)
-
Zugriff auf einen Anmeldeknoten im AWS PCS-Cluster
Verfahren
-
Stellen Sie über die EC2-Konsole eine Verbindung zu einem Anmeldeknoten her.
-
Wählen Sie in der EC2-Konsole Instances aus.
-
Wählen Sie Ihre Anmeldeknoteninstanz aus.
-
Wählen Sie Connect aus.
-
-
Identifizieren Sie den Namen des Ziel-Rechenknotens mit
sinfooderscontrol show node.sinfo # or scontrol show node -
Führen Sie den Reboot-Befehl mit einer der folgenden Optionen aus:
Warnung
Nicht
nextstate=DOWNzusammen mit demscontrol rebootBefehl verwenden. Dieser Parameter markiert den Knoten als fehlerhaft und löst die Ersetzung der Instanz aus.-
Grundlegender Neustart (wartet, bis der Knoten inaktiv wird):
scontrol rebootnodename -
Sofortiger Neustart (entleert den Knoten und startet neu, wenn die Jobs abgeschlossen sind):
scontrol reboot ASAPnodename -
Aus gutem Grund neu starten:
scontrol reboot ASAP reason="troubleshooting"nodename -
Neustart mit Resume-Status:
scontrol reboot ASAP nextstate=RESUMEnodename
-
-
Überwachen Sie den Fortschritt des Neustarts mit
scontrol show node.scontrol show nodenodename -
Stellen Sie sicher, dass der Knoten nach Abschluss des Neustarts wieder betriebsbereit ist.