View a markdown version of this page

Verwendung von Gruppenplanung bei der Aufgabenverwaltung von Amazon SageMaker HyperPod - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Verwendung von Gruppenplanung bei der Aufgabenverwaltung von Amazon SageMaker HyperPod

Beim Training für verteiltes ML erfordert ein Job oft, dass mehrere Pods gleichzeitig über Knoten laufen und von Pod zu Pod kommunizieren. HyperPod Bei der Aufgabenverwaltung wird die waitForPodsReady Funktion von Kueue verwendet, um Gruppenplanung zu implementieren. Wenn diese Option aktiviert ist, wird die Arbeitslast von Kueue überwacht, bis alle Pods bereit sind, d. h. geplant sind, ausgeführt werden und die optionale Bereitschaftsprüfung bestanden haben. Wenn nicht alle Pods des Workloads innerhalb des konfigurierten Timeouts bereit sind, wird der Workload entfernt und erneut in die Warteschlange gestellt.

Die Gruppenplanung bietet die folgenden Vorteile:

  • Beugt Ressourcenverschwendung vor — Kueue verschiebt die Arbeitslast und setzt sie erneut in die Warteschlange, wenn nicht alle Pods bereit sind. So wird sichergestellt, dass Ressourcen nicht auf unbestimmte Zeit durch teilweise ausgeführte Workloads blockiert werden.

  • Vermeidet Deadlocks — Verhindert, dass Jobs nur einen Teil der Ressourcen beanspruchen und sich gegenseitig auf unbestimmte Zeit blockieren.

  • Automatische Wiederherstellung — Wenn die Pods innerhalb des Timeouts nicht bereit sind, wird der Workload entfernt und mit konfigurierbarem exponentiellem Backoff erneut in die Warteschlange gestellt, anstatt auf unbestimmte Zeit hängen zu bleiben.

Aktivieren Sie die Gruppenplanung

Um die Gruppenplanung zu aktivieren, müssen Sie über einen HyperPod Amazon EKS-Cluster verfügen, auf dem das Amazon EKS-Add-on zur Aufgabenverwaltung installiert ist. Der Status des Add-ons muss Active oder seinDegraded.

Anmerkung

Die Gruppenplanung kann auch direkt konfiguriert werden, kubectl indem die Kueue-Konfiguration auf dem Cluster bearbeitet wird.

Aktivieren Sie die Gruppenplanung (SageMaker AI-Konsole)
  1. Öffnen Sie die Amazon SageMaker AI-Konsole und navigieren Sie zu Ihrem HyperPod Cluster.

  2. Wählen Sie die Registerkarte „Richtlinienverwaltung“.

  3. Öffnen Sie im Abschnitt Aufgabenverwaltung die Option Aktionen und wählen Sie dann Gruppenplanung konfigurieren aus.

  4. Schalte die Gruppenplanung ein und konfiguriere die Einstellungen.

  5. Wählen Sie Speichern. Der Kueue-Controller wird neu gestartet, um die Änderung zu übernehmen.

Konfigurationseinstellungen für Gruppenplanung

In der folgenden Tabelle werden die Konfigurationseinstellungen für die Gruppenplanung beschrieben.

Einstellung Description Standard
timeout Wie lange Kueue darauf wartet, dass alle Pods bereit sind, bevor die Arbeitslast entfernt und erneut angefordert wird. 5m
recoveryTimeout Wie lange Kueue darauf wartet, dass ein Pod nach einem Knotenausfall wiederhergestellt ist, bevor die Arbeitslast erneut in Anspruch genommen wird. Auf deaktivieren setzen. 0s Standardmäßig auf den Wert von, timeout wenn nicht gesetzt. 5m
blockAdmission Wenn diese Option aktiviert ist, werden Workloads sequentiell zugelassen. Es wird kein neuer Workload zugelassen, bis alle Pods des aktuellen Workloads bereit sind. Beugt Deadlocks auf Clustern mit begrenzten Ressourcen vor. Aus
requeuingStrategy timestamp Ob die Reihenfolge der Benutzer in die Warteschlange gestellt wird Creation (ursprüngliche Übermittlungszeit, Beibehaltung der Warteschlangenposition) oder Eviction (Zeitpunkt der letzten Räumung, wodurch wiederholt fehlgeschlagene Jobs effektiv weniger priorisiert werden). Räumung
requeuingStrategy backoffLimitCount Maximale Anzahl von Requeue-Versuchen, bevor Kueue den Workload dauerhaft deaktiviert. Lassen Sie das Feld leer für eine unbegrenzte Anzahl von Wiederholungen. Unbegrenzt
requeuingStrategy backoffBaseSeconds Die Basiszeit in Sekunden für einen exponentiellen Backoff, wenn nach jedem aufeinanderfolgenden Timeout eine Arbeitslast erneut angefordert wird. Der Exponent ist 2. 60er Jahre
requeuingStrategy backoffMaxSeconds Obergrenze für die exponentielle Backoff-Verzögerung. Sobald Kueue erreicht ist, setzt Kueue die Warteschlange in diesem festen Intervall fort. 3600s
Anmerkung

Wenn Sie die Einstellungen für die Gruppenplanung ändern, wird der Kueue-Controller neu gestartet, was die Auftragsannahme vorübergehend verzögern kann. Dies gilt unabhängig davon, ob Sie einen Wert aktivieren, deaktivieren oder aktualisieren. Laufende Jobs werden nicht unterbrochen.

Anmerkung

Die Gruppenplanung erfolgt clusterweit. Sie gilt für alle Kueue-managed Workloads im Cluster, nicht nur für bestimmte Teams oder Warteschlangen.