Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Verwendung von Gruppenplanung bei der Aufgabenverwaltung von Amazon SageMaker HyperPod
Beim Training für verteiltes ML erfordert ein Job oft, dass mehrere Pods gleichzeitig über Knoten laufen und von Pod zu Pod kommunizieren. HyperPod Bei der Aufgabenverwaltung wird die waitForPodsReady Funktion von Kueue verwendet, um Gruppenplanung zu implementieren. Wenn diese Option aktiviert ist, wird die Arbeitslast von Kueue überwacht, bis alle Pods bereit sind, d. h. geplant sind, ausgeführt werden und die optionale Bereitschaftsprüfung bestanden haben. Wenn nicht alle Pods des Workloads innerhalb des konfigurierten Timeouts bereit sind, wird der Workload entfernt und erneut in die Warteschlange gestellt.
Die Gruppenplanung bietet die folgenden Vorteile:
-
Beugt Ressourcenverschwendung vor — Kueue verschiebt die Arbeitslast und setzt sie erneut in die Warteschlange, wenn nicht alle Pods bereit sind. So wird sichergestellt, dass Ressourcen nicht auf unbestimmte Zeit durch teilweise ausgeführte Workloads blockiert werden.
-
Vermeidet Deadlocks — Verhindert, dass Jobs nur einen Teil der Ressourcen beanspruchen und sich gegenseitig auf unbestimmte Zeit blockieren.
-
Automatische Wiederherstellung — Wenn die Pods innerhalb des Timeouts nicht bereit sind, wird der Workload entfernt und mit konfigurierbarem exponentiellem Backoff erneut in die Warteschlange gestellt, anstatt auf unbestimmte Zeit hängen zu bleiben.
Aktivieren Sie die Gruppenplanung
Um die Gruppenplanung zu aktivieren, müssen Sie über einen HyperPod Amazon EKS-Cluster verfügen, auf dem das Amazon EKS-Add-on zur Aufgabenverwaltung installiert ist. Der Status des Add-ons muss Active oder seinDegraded.
Anmerkung
Die Gruppenplanung kann auch direkt konfiguriert werden, kubectl indem die Kueue-Konfiguration auf dem Cluster bearbeitet wird.
Aktivieren Sie die Gruppenplanung (SageMaker AI-Konsole)
-
Öffnen Sie die Amazon SageMaker AI-Konsole
und navigieren Sie zu Ihrem HyperPod Cluster. -
Wählen Sie die Registerkarte „Richtlinienverwaltung“.
-
Öffnen Sie im Abschnitt Aufgabenverwaltung die Option Aktionen und wählen Sie dann Gruppenplanung konfigurieren aus.
-
Schalte die Gruppenplanung ein und konfiguriere die Einstellungen.
-
Wählen Sie Speichern. Der Kueue-Controller wird neu gestartet, um die Änderung zu übernehmen.
Konfigurationseinstellungen für Gruppenplanung
In der folgenden Tabelle werden die Konfigurationseinstellungen für die Gruppenplanung beschrieben.
| Einstellung | Description | Standard |
|---|---|---|
timeout |
Wie lange Kueue darauf wartet, dass alle Pods bereit sind, bevor die Arbeitslast entfernt und erneut angefordert wird. | 5m |
recoveryTimeout |
Wie lange Kueue darauf wartet, dass ein Pod nach einem Knotenausfall wiederhergestellt ist, bevor die Arbeitslast erneut in Anspruch genommen wird. Auf deaktivieren setzen. 0s Standardmäßig auf den Wert von, timeout wenn nicht gesetzt. |
5m |
blockAdmission |
Wenn diese Option aktiviert ist, werden Workloads sequentiell zugelassen. Es wird kein neuer Workload zugelassen, bis alle Pods des aktuellen Workloads bereit sind. Beugt Deadlocks auf Clustern mit begrenzten Ressourcen vor. | Aus |
requeuingStrategy timestamp |
Ob die Reihenfolge der Benutzer in die Warteschlange gestellt wird Creation (ursprüngliche Übermittlungszeit, Beibehaltung der Warteschlangenposition) oder Eviction (Zeitpunkt der letzten Räumung, wodurch wiederholt fehlgeschlagene Jobs effektiv weniger priorisiert werden). |
Räumung |
requeuingStrategy backoffLimitCount |
Maximale Anzahl von Requeue-Versuchen, bevor Kueue den Workload dauerhaft deaktiviert. Lassen Sie das Feld leer für eine unbegrenzte Anzahl von Wiederholungen. | Unbegrenzt |
requeuingStrategy backoffBaseSeconds |
Die Basiszeit in Sekunden für einen exponentiellen Backoff, wenn nach jedem aufeinanderfolgenden Timeout eine Arbeitslast erneut angefordert wird. Der Exponent ist 2. | 60er Jahre |
requeuingStrategy backoffMaxSeconds |
Obergrenze für die exponentielle Backoff-Verzögerung. Sobald Kueue erreicht ist, setzt Kueue die Warteschlange in diesem festen Intervall fort. | 3600s |
Anmerkung
Wenn Sie die Einstellungen für die Gruppenplanung ändern, wird der Kueue-Controller neu gestartet, was die Auftragsannahme vorübergehend verzögern kann. Dies gilt unabhängig davon, ob Sie einen Wert aktivieren, deaktivieren oder aktualisieren. Laufende Jobs werden nicht unterbrochen.
Anmerkung
Die Gruppenplanung erfolgt clusterweit. Sie gilt für alle Kueue-managed Workloads im Cluster, nicht nur für bestimmte Teams oder Warteschlangen.