View a markdown version of this page

HyperPod Mithilfe des trainierenden Operators - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

HyperPod Mithilfe des trainierenden Operators

Der Amazon SageMaker HyperPod Training Operator hilft Ihnen dabei, die generative KI-Modellentwicklung zu beschleunigen, indem er das verteilte Training über große GPU-Cluster hinweg effizient verwaltet. Er bietet intelligente Funktionen zur Fehlerbehebung, Erkennung von Blockierungen und Verwaltungsfunktionen auf Prozessebene, die Trainingsunterbrechungen minimieren und Kosten senken. Im Gegensatz zur herkömmlichen Trainingsinfrastruktur, bei der der Job bei Ausfällen komplett neu gestartet werden muss, implementiert dieser Operator die Wiederherstellung chirurgischer Prozesse, um einen reibungslosen Ablauf Ihrer Trainingsaufgaben zu gewährleisten.

Der Operator arbeitet auch mit den HyperPod Zustands- und Beobachtbarkeitsfunktionen, die in Echtzeit Einblick in die Trainingsausführung bieten und wichtige Kennzahlen wie Verlustspitzen und Durchsatzverschlechterung automatisch überwachen. Sie können Wiederherstellungsrichtlinien durch einfache YAML-Konfigurationen ohne Codeänderungen definieren, sodass Sie schnell auf nicht wiederherstellbare Trainingszustände reagieren und diese beheben können. Diese Überwachungs- und Wiederherstellungsfunktionen arbeiten zusammen, um eine optimale Trainingsleistung aufrechtzuerhalten und gleichzeitig den betrieblichen Aufwand zu minimieren.

Kueue ist für diesen Schulungsoperator zwar nicht erforderlich, Ihr Clusteradministrator kann es jedoch installieren und konfigurieren, um die Funktionen zur Jobplanung zu verbessern. Weitere Informationen finden Sie in der offiziellen Dokumentation zu Kueue.

Anmerkung

Um den Trainingsoperator verwenden zu können, müssen Sie die neueste HyperPod AMI-Version verwenden. Verwenden Sie für das Upgrade den UpdateClusterSoftware API-Vorgang. Wenn Sie HyperPod Task Governance verwenden, muss es sich ebenfalls um die neueste Version handeln.

Unterstützte Versionen

Der HyperPod Trainingsoperator funktioniert nur mit bestimmten Versionen von Kubernetes, Kueue und. HyperPod In der folgenden Liste finden Sie die vollständige Liste der kompatiblen Versionen.

Anmerkung

Wir erheben routinemäßig bestimmte aggregierte und anonymisierte Betriebskennzahlen, um die grundlegende Serviceverfügbarkeit sicherzustellen. Die Erstellung dieser Kennzahlen erfolgt vollständig automatisiert und erfordert keine menschliche Überprüfung des zugrunde liegenden Modell-Trainingsaufwands. Diese Kennzahlen beziehen sich auf den Arbeitsablauf, das Ressourcenmanagement und wichtige Servicefunktionen.