Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
HyperPod Funktionen für Checkpointless-Training
Auf den folgenden Seiten erfährst du mehr über die Trainingsfunktionen des Checkpointless-Trainings.
Themen
Repositorys für Schulungen von Amazon SageMaker HyperPod Checkpointless
HyperPod Checkpointless-Training
Checkpointless-Training wird durch drei Optimierungstracks ermöglicht, die gleichzeitig ablaufen:
-
Verbesserungen bei der Kommunikationsinitialisierung (NCCL und Gloo) — Beseitigen Sie Kommunikationsengpässe, indem Sie Rank-Peer- und Ring-Informationen dezentralisieren (rotes Feld unten).
-
Optimierungen beim Laden von Daten — Reduzieren Sie die Zeit, die benötigt wird, um den ersten Datenstapel bei Neustartvorgängen bereitzustellen (orangefarbene Felder unten).
-
Reduzierung des Mehraufwands bei Programmneustarts — Minimieren Sie die Kosten für Neustarts und ermöglichen Sie durch eine Prozesswiederherstellung auf funktionstüchtigen Knoten (blaue und grüne Felder unten) den Nachschub ohne Kontrollpunkte.