View a markdown version of this page

Ausführen von Trainingsjobs auf einem heterogenen Cluster - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Ausführen von Trainingsjobs auf einem heterogenen Cluster

Mithilfe der Funktion für heterogene Cluster von SageMaker Training können Sie einen Trainingsjob mit mehreren Typen von ML-Instances ausführen, um die Ressourcen besser skalieren und für verschiedene ML-Trainingsaufgaben und -zwecke nutzen zu können. Wenn Ihr Trainingsjob auf einem Cluster mit GPU-Instances beispielsweise unter einer niedrigen GPU-Auslastung leidet und aufgrund von CPU-intensive Aufgaben CPU-Engpässe auftreten, kann die Verwendung eines heterogenen Clusters dazu beitragen, CPU-intensive Aufgaben auszulagern, indem kosteneffizientere CPU-Instanzgruppen hinzugefügt, solche Engpassprobleme behoben und eine bessere GPU-Auslastung erreicht werden.

Anmerkung

Diese Funktion ist im Python SDK v2.98.0 und höher verfügbar. SageMaker

Anmerkung

Diese Funktion ist über die SageMaker AI-Klasse verfügbar. ModelTrainer Unterstützte Frameworks sind PyTorch v1.10 oder höher und TensorFlow v2.6 oder höher.

Weitere Informationen finden Sie im Blog Verbessern Sie das Preis-Leistungs-Verhältnis Ihres Modelltrainings mithilfe heterogener Amazon SageMaker AI-Cluster.