View a markdown version of this page

Configuration de tâches d’entraînement pour accéder à des jeux de données - Amazon SageMaker AI

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Configuration de tâches d’entraînement pour accéder à des jeux de données

Lorsque vous créez une tâche d’entraînement, vous spécifiez l’emplacement des jeux de données dans le stockage de données de votre choix pour les jeux de données d’entraînement et le mode d’entrée des données de la tâche. Amazon SageMaker AI prend en charge Amazon Simple Storage Service (Amazon S3), Amazon Elastic File System (Amazon EFS) et Amazon FSx pour Lustre. Vous pouvez choisir l’un des modes d’entrée pour diffuser le jeu de données en temps réel ou télécharger le jeu de données complet au début de la tâche d’entraînement.

Note

Votre ensemble de données doit se trouver au même endroit Région AWS que la tâche de formation.

SageMaker Modes de saisie AI et AWS options de stockage dans le cloud

Cette section fournit une vue d'ensemble des modes de saisie de fichiers pris en charge par SageMaker les données stockées dans Amazon EFS et Amazon FSx pour Lustre.

Résumé des modes de saisie SageMaker AI pour Amazon S3 et les systèmes de fichiers dans Amazon EFS et Amazon FSx pour Lustre.
  • Le mode Fichier présente une vue du système de fichiers du jeu de données dans le conteneur d'entraînement. Il s'agit du mode d'entrée par défaut si vous ne spécifiez pas explicitement l'une des deux autres options. Si vous utilisez le mode fichier, SageMaker AI télécharge les données d'entraînement depuis l'emplacement de stockage vers un répertoire local du conteneur Docker. L'entraînement commence une fois que le jeu de données complet a été téléchargé. En mode fichier, l'instance d'entraînement doit disposer d'un espace de stockage suffisant pour contenir l'ensemble du jeu de données. La vitesse de téléchargement du mode fichier dépend de la taille du jeu de données, de la taille moyenne des fichiers et du nombre de fichiers. Vous pouvez configurer le jeu de données pour le mode fichier en fournissant un préfixe Amazon S3, un fichier manifeste ou un fichier manifeste augmenté. Vous devez utiliser un préfixe S3 lorsque tous les fichiers de votre jeu de données se trouvent dans un préfixe S3 commun. Le mode Fichier est compatible avec le mode local SageMaker AI (démarrage interactif d'un conteneur d' SageMaker entraînement en quelques secondes). Pour les formations distribuées, vous pouvez partager le jeu de données entre plusieurs instances avec l'option ShardedByS3Key.

  • Le mode Fichier rapide fournit un accès au système de fichiers à une source de données Amazon S3 tout en tirant parti de l'avantage de performance du mode tube. Au début de l'entraînement, le mode Fichier rapide identifie les fichiers de données, mais ne les télécharge pas. L'entraînement peut commencer sans attendre le téléchargement du jeu de données. Cela signifie que le kit SDK prend moins de temps lorsque le préfixe Amazon S3 fourni contient moins de fichiers.

    Contrairement au mode tube, le mode Fichier rapide fonctionne avec un accès aléatoire aux données. Cependant, il fonctionne mieux lorsque les données sont lues de manière séquentielle. Le mode Fichier rapide ne prend pas en charge les fichiers manifestes augmentés.

    Le mode fichier rapide expose les objets S3 à l'aide d'une interface de système de POSIX-compliant fichiers, comme si les fichiers étaient disponibles sur le disque local de votre instance de formation. Il diffuse du contenu S3 à la demande alors que votre script d'entraînement consomme des données. Cela signifie que votre jeu de données n'a plus besoin de tenir dans l'espace de stockage de l'instance d'entraînement dans son ensemble et que vous n'avez pas besoin d'attendre que le jeu de données soit téléchargé sur l'instance d'entraînement avant de commencer l'entraînement. Fichier rapide ne prend actuellement en charge que les préfixes S3 (il ne prend pas en charge les manifestes et les manifestes augmentés). Le mode de fichier rapide est compatible avec le mode local SageMaker AI.

    Note

    L'utilisation du mode Fast File peut entraîner une augmentation CloudTrail des coûts en raison de la journalisation supplémentaire de :

    • Événements de données Amazon S3 (si cette option est activée CloudTrail).

    • AWS KMS événements de déchiffrement lors de l'accès à des objets Amazon S3 chiffrés à l'aide de AWS KMS clés.

    • Événements de gestion liés aux AWS KMS opérations.

    Vérifiez vos coûts CloudTrail de configuration et de surveillance si la CloudTrail journalisation est activée pour ces types d'événements.

  • Le mode Canal diffuse les données directement à partir d'une source de données Amazon S3. Le streaming peut fournir des temps de démarrage plus rapides et un meilleur débit que le mode .

    Lorsque vous diffusez les données directement, vous pouvez réduire la taille des volumes Amazon EBS utilisés par l'instance d'entraînement. En mode Canal, l'espace disque doit être suffisant pour stocker votre artefact de modèle final.

    Il s'agit d'un autre mode de diffusion en continu qui est largement remplacé par le mode Fichier rapide plus récent et plus simple à utiliser. En mode canal, les données sont préextraites depuis Amazon S3 avec une simultanéité et un débit élevés, puis transmises vers un canal nommé, également appelé canal First-In-First-Out (FIFO) pour son comportement. Chaque canal ne peut être lu que par un seul processus. Une extension spécifique à l' SageMaker IA pour intégrer TensorFlow facilement le mode Pipe dans le chargeur de TensorFlow données natif pour la diffusion de texte, de TFRecords ou de formats de fichiers Recordio. Le mode Canal prend également en charge le partitionnement et le brassage gérés des données.

  • Amazon S3 Express One Zone est une classe de stockage haute performance à zone de disponibilité unique qui peut fournir un accès aux données cohérent en millisecondes à un chiffre pour les applications les plus sensibles à la latence, y compris la formation des modèles. SageMaker Amazon S3 Express One Zone permet aux clients de regrouper leurs ressources de stockage d'objets et de calcul dans une seule zone de AWS disponibilité, optimisant ainsi les performances de calcul et les coûts tout en augmentant la vitesse de traitement des données. Pour augmenter davantage la vitesse d’accès et prendre en charge des centaines de milliers de demandes par seconde, les données sont stockées dans un nouveau type de compartiment, un compartiment de répertoires Amazon S3.

    SageMaker La formation aux modèles d'IA prend en charge les compartiments de répertoires Amazon S3 Express One Zone hautes performances en tant qu'emplacement de saisie des données pour le mode fichier, le mode fichier rapide et le mode canal. Pour utiliser Amazon S3 Express One Zone, entrez l’emplacement du compartiment de répertoires Amazon S3 Express One Zone au lieu d’un compartiment Amazon S3. Fournissez l’ARN du rôle IAM avec la politique de contrôle d’accès et d’autorisation requise. Pour plus d'informations, consultez AmazonSageMakerFullAccesspolicy. Vous pouvez uniquement chiffrer les données de sortie de votre SageMaker IA dans des compartiments de répertoires avec un chiffrement côté serveur avec des clés gérées Amazon S3 (). SSE-S3 Server-side le chiffrement avec AWS KMS clés (SSE-KMS) n'est actuellement pas pris en charge pour le stockage des données de sortie SageMaker AI dans des compartiments de répertoires. Pour plus d’informations, consultez Amazon S3 Express One Zone.

  • Amazon FSx pour Lustre — FSx for Lustre peut évoluer jusqu'à des centaines de gigaoctets de débit et des millions d'IOPS avec une récupération de fichiers à faible latence. Lorsque vous commencez une tâche de formation, SageMaker AI monte le système de fichiers FSx for Lustre sur le système de fichiers de l'instance de formation, puis lance votre script de formation. Le montage lui-même est une opération relativement rapide qui ne dépend pas de la taille du jeu de données stocké dans FSx for Lustre.

    Pour accéder à FSx for Lustre, votre mission de formation doit se connecter à un Amazon Virtual Private Cloud (VPC), ce qui nécessite une DevOps configuration et une implication. Pour éviter les coûts de transfert de données, le système de fichiers utilise une seule zone de disponibilité et vous devez spécifier un sous-réseau VPC qui correspond à cet ID de zone de disponibilité lors de l'exécution de la tâche d'entraînement.

  • Amazon EFS — Pour utiliser Amazon EFS comme source de données, les données doivent déjà se trouver dans Amazon EFS avant la formation. SageMaker AI monte le système de fichiers Amazon EFS spécifié sur l'instance d'entraînement, puis lance votre script d'entraînement. Votre entraînement doit être connecté à un VPC pour accéder à Amazon EFS.

    Astuce

    Pour en savoir plus sur la façon de spécifier la configuration de votre VPC pour SageMaker AI ModelTrainers, consultez la section Utiliser les systèmes de fichiers comme entrées d'entraînement dans la documentation du SDK SageMaker AI Python.