Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Aktualisierung der Scheduler-Version eines Clusters in AWS STCK
AWS Mit PCS können Sie die Scheduler-Version auf einem vorhandenen Cluster aktualisieren, ohne Ihre Infrastruktur neu aufbauen zu müssen. Durch Versionsupdates wird der Cluster-Controller auf eine neuere Slurm-Hauptversion umgestellt, sodass Sie auf neue Funktionen, Leistungsverbesserungen und Sicherheitspatches zugreifen können. Neuere Versionen haben auch eine längere Lebensdauer des Supports, bevor sie das Ende ihrer Lebensdauer erreichen.
-Übersicht
Ein Scheduler-Versionsupdate umfasst drei Vorgänge:
-
Ziel-AMIs vorbereiten — Erstellen oder identifizieren Sie AMIs, die die Ziel-Slurm-Version und den neuesten AWS PCS-Agenten enthalten.
-
Den Cluster aktualisieren (
UpdateCluster) — Verschiebt den Controller auf die Ziel-Slurm-Hauptversion. -
Compute Node Groups aktualisieren (
UpdateComputeNodeGroup) — Verweisen Sie jede Compute-Knotengruppe auf ein neues AMI, sodass neue Knoten die Zielversion verwenden. Weitere Informationen finden Sie unter Aktualisierung eines AWS PCS-Compute-Knotengruppe.
Es gibt zwei Pfade, denen Sie folgen können. Wählen Sie eine Option, die darauf basiert, ob Sie eine Arbeitsunterbrechung tolerieren können.
Unabhängig davon, für welche Option Sie sich entscheiden, müssen alle Knoten im Cluster vor dem Start des Prozesses dieselbe Version „A“ ausführen, und am Ende des Prozesses müssen alle Knoten dieselbe Version „B“ ausführen. Option 2 funktioniert unabhängig von Ihrer Clusterkonfiguration.
| Option 1: Fortlaufendes Update | Option 2: Full-fleet Wartungsstopp | |
|---|---|---|
| Ausführen von Aufgaben | Erfordert keine Kündigung des Jobs | Alle laufenden Jobs wurden beendet |
| Mindestversion des Cluster-Controllers | 24.05 | Keine Einschränkung |
| Rechne die Flotte nach dem Controller-Update | Vorübergehend gemischte Versionen; Entleerungsschritte erforderlich. Wir empfehlen, den Zeitraum, in dem gemischte Versionen in einem Cluster verwendet werden, so gering wie möglich zu halten. | Alle Knoten starten in der Zielversion neu |
Anmerkung
Stellen Sie vor dem Start sicher, dass auf allen Rechenknoten der neueste Patch von Slurm Version A und der neueste AWS PCS-Agent installiert ist.
Einschränkungen
Wenn Ihr Cluster Spank-Plugins (Plugstack-Konfiguration) verwendet, unterstützt AWS PCS Option 1 nicht. Ein fortlaufendes Update kann zu einer Nichtübereinstimmung der Plugstack-Konfigurationsversion und zu Plugin-Fehlern führen.
Versionskompatibilität
In der folgenden Tabelle sind die unterstützten Zielversionen aufgeführt, auf die je nach aktueller Cluster-Version aktualisiert werden kann. Es wird immer empfohlen, ein Upgrade auf die neueste zulässige Version durchzuführen (fett dargestellt).
Der Cluster und alle Rechenknoten müssen immer dieselbe Slurm-Version ausführen, bevor ein Update initiiert wird.
| Aktuelle Cluster-Version | Kompatible Zielversionen |
|---|---|
| 25.11 | N/A |
| 25,05 | 25,11 |
| 24.11 (EOL) | 25.11, 25,05 |
| 24,05 (EOL) | 25,11, 25,05, 24,11 |
| 23,11 (EOL) | (nur über Option 2) 25.05, 24.11, 24.05 |
Weitere Informationen zu unterstützten Versionen und Enddaten finden Sie unter. Slurm-Versionen in AWS 5 STCK
Sie können nicht mehr als drei Hauptversionen in einem einzigen Update überspringen. Wenn Ihre Zielversion Ihrer aktuellen Version mehr als drei Hauptversionen voraus ist, führen Sie das Update in mehreren aufeinanderfolgenden Schritten durch. Ein Beispiel mit mehreren Schritten finden Sie unterBeispiel: Aktualisierung über mehrere Versionen hinweg.
Auswirkungen auf laufende Jobs
Während des Updates ist der Slurm-Controller kurzzeitig nicht verfügbar. Dies hat folgende Auswirkungen:
-
Laufende Jobs — Bei Option 1 (fortlaufendes Update) werden Jobs, die bereits auf Rechenknoten ausgeführt werden, weiterhin ausgeführt. Für die Rechenknoten muss der Controller nicht für die aktive Auftragsausführung verfügbar sein. Bei Option 2 (vollständige Wartung der Flotte) werden alle laufenden Jobs beendet, wenn die Flotte heruntergefahren wird.
-
Neue Aufträge — Sie können keine neuen Jobs einreichen oder Scheduler-Befehle ausführen, solange der Controller nicht verfügbar ist.
-
Skalierung — Die automatische Skalierung wird während des Updates unterbrochen. Bis zum Abschluss des Updates werden keine neuen Instances gestartet und keine Instances wegen Down-Scale-Down beendet.
-
Buchhaltungsdaten — Wenn die Buchhaltung aktiviert ist, bleiben die Buchhaltungsdaten während des gesamten Updates erhalten. In der Buchhaltungsdatenbank gespeicherte Auftragsdatensätze bleiben auch nach der Versionsänderung bestehen.
-
Slurm-REST-API — Wenn die Slurm-REST-API auf dem Cluster aktiviert ist, wird sie im Rahmen des Vorgangs automatisch auf die neue Scheduler-Version aktualisiert.
UpdateClusterDer REST-API-Endpunkt ist während des Updates nicht verfügbar und wird wieder aufgenommen, wenn der Cluster wieder in den Status zurückkehrt.ACTIVEWeitere Informationen finden Sie unter Fügen Sie die REST-API hinzu AWS 5 STCK.
Kombinieren von Versionsupdates mit Konfigurationsänderungen
Sie können ein Versionsupdate mit anderen Konfigurationsänderungen in einer einzigen UpdateCluster Anfrage kombinieren. Beispielsweise können Sie die Scheduler-Version aktualisieren und die Abrechnung im selben Vorgang aktivieren.
Anmerkung
Fügen Sie keine für die Zielversion spezifischen Slurm-Einstellungen hinzu, solange die Flotte noch Knoten der Vorgängerversion enthält. Die Konfiguration wird auf alle Knoten verteilt; der alte Knoten erkennt slurmd möglicherweise keine neuen Parameter.