View a markdown version of this page

Avvio di processi di formazione distribuiti con SMDDP utilizzando Python SDK SageMaker - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Avvio di processi di formazione distribuiti con SMDDP utilizzando Python SDK SageMaker

Per eseguire un processo di formazione distribuito con lo script adattato daAdattamento dello script di addestramento per l’utilizzo delle operazioni collettive SMDDP, utilizza il framework di SageMaker Python SDK o gli stimatori generici specificando lo script di addestramento preparato come script di partenza e la configurazione di addestramento distribuita.

Questa pagina illustra come utilizzare l'SageMaker AI Python SDK in due modi.

  • Se desideri ottenere una rapida adozione del tuo lavoro di formazione distribuito in SageMaker intelligenza artificiale, configura una classe di SageMaker stimatore AI PyTorch o TensorFlow framework. Lo stimatore del framework preleva lo script di training e abbina automaticamente l'URI corretto dell'immagine del DLC ( TensorFlow Deep Learning Containers) predefinito PyTorch , dato il valore specificato nel parametro. framework_version

  • Se desideri estendere uno dei contenitori predefiniti o creare un contenitore personalizzato per creare il tuo ambiente ML con SageMaker AI, utilizza la Estimator classe generica SageMaker AI e specifica l'URI dell'immagine del contenitore Docker personalizzato ospitato nel tuo Amazon Elastic Container Registry (Amazon ECR).

I tuoi set di dati di formazione devono essere archiviati in Amazon S3 o Amazon FSx for Lustre nel luogo Regione AWS in cui inizi il tuo percorso di formazione. Se utilizzi notebook Jupyter, dovresti avere un'istanza del notebook o un' SageMaker app Studio Classic in esecuzione sullo stesso. SageMaker Regione AWS Per ulteriori informazioni sull'archiviazione dei dati di allenamento, consulta la documentazione sugli input dei dati di Python SDK SageMaker .

Suggerimento

È vivamente consigliabile utilizzare Amazon FSx per Lustre anziché Amazon S3 per migliorare le prestazioni di addestramento. Amazon FSx offre un throughput più elevato e una latenza inferiore rispetto ad Amazon S3.

Suggerimento

Per eseguire correttamente il training distribuito sui tipi di EFA-enabled istanze, è necessario abilitare il traffico tra le istanze configurando il gruppo di sicurezza del VPC in modo da consentire tutto il traffico in entrata e in uscita da e verso il gruppo di sicurezza stesso. Per informazioni su come impostare le regole dei gruppi di sicurezza, consulta la Fase 1: Preparare un gruppo di EFA-enabled sicurezza nella Amazon EC2 User Guide.

Scegli uno degli argomenti seguenti per istruzioni su come eseguire un job di addestramento distribuito del tuo script di addestramento. Dopo aver avviato un processo di formazione, puoi monitorare l'utilizzo del sistema e modellare le prestazioni utilizzando AmazonSageMaker Debugger Amazon. CloudWatch

Oltre a seguire le istruzioni riportate nei seguenti argomenti per saperne di più sui dettagli tecnici, ti consigliamo anche di provare Esempi di librerie di parallelismo dei dati di Amazon SageMaker AI per iniziare.