View a markdown version of this page

HyperPod Funktionen für Checkpointless-Training - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

HyperPod Funktionen für Checkpointless-Training

Auf den folgenden Seiten erfährst du mehr über die Trainingsfunktionen des Checkpointless-Trainings.

Repositorys für Schulungen von Amazon SageMaker HyperPod Checkpointless

HyperPod Checkpointless-Training beschleunigt die Wiederherstellung nach Clusterfehlern in großen verteilten Trainingsumgebungen durch Optimierungen auf Framework-Ebene. Diese Optimierungen werden über ein Basis-Container-Image bereitgestellt, das erweiterte Verbesserungen der NCCL-Initialisierung, Optimierungen beim Laden von Daten sowie Komponenten für die prozessinterne und checkpointlose Wiederherstellung umfasst. Das HyperPod Checkpointless-Trainingspaket basiert auf dieser Grundlage.

Checkpointless-Training wird durch drei Optimierungstracks ermöglicht, die gleichzeitig ablaufen:

  • Verbesserungen bei der Kommunikationsinitialisierung (NCCL und Gloo) — Beseitigen Sie Kommunikationsengpässe, indem Sie Rank-Peer- und Ring-Informationen dezentralisieren (rotes Feld unten).

  • Optimierungen beim Laden von Daten — Reduzieren Sie die Zeit, die benötigt wird, um den ersten Datenstapel bei Neustartvorgängen bereitzustellen (orangefarbene Felder unten).

  • Reduzierung des Mehraufwands bei Programmneustarts — Minimieren Sie die Kosten für Neustarts und ermöglichen Sie durch eine Prozesswiederherstellung auf funktionstüchtigen Knoten (blaue und grüne Felder unten) den Nachschub ohne Kontrollpunkte.

Zwei GPUs, auf denen Modelltrainingsschritte parallel ausgeführt werden, wobei jeder Schritt mit Daten versorgt wird und die Checkpoints regelmäßig gespeichert werden.