Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Allocation d'un quota de partition GPU
Vous pouvez étendre l'allocation des quotas de calcul pour prendre en charge le partitionnement du GPU, ce qui permet un partage précis des ressources au niveau de la partition GPU. Lorsque le partitionnement des GPU est activé sur les GPU pris en charge dans le cluster, chaque GPU physique peut être partitionné en plusieurs GPU isolés avec des allocations multiprocesseurs de calcul, de mémoire et de streaming définies. Pour plus d'informations sur le partitionnement du GPU, consultezUtilisation de partitions GPU dans Amazon SageMaker HyperPod. Vous pouvez allouer des partitions GPU spécifiques à des équipes, ce qui permet à plusieurs équipes de partager un seul GPU tout en maintenant une isolation au niveau du matériel et des performances prévisibles.
Par exemple, une instance ml.p5.48xlarge avec 8 GPU H100 peut être partitionnée en partitions GPU, et vous pouvez allouer des partitions individuelles à différentes équipes en fonction des exigences de leurs tâches. Lorsque vous spécifiez des allocations de partition GPU, la gouvernance des HyperPod tâches calcule des quotas de vCPU et de mémoire proportionnels en fonction de la partition GPU, de la même manière que l'allocation. GPU-level Cette approche optimise l'utilisation du GPU en éliminant la capacité inactive et en permettant un partage rentable des ressources entre plusieurs tâches simultanées sur le même GPU physique.
Création de quotas de calcul
aws sagemaker create-compute-quota \ --name "fractional-gpu-quota" \ --compute-quota-config '{ "ComputeQuotaResources": [ { "InstanceType": "ml.p4d.24xlarge", "AcceleratorPartition": { "Count": 4, "Type": "mig-1g.5gb" } } ], "ResourceSharingConfig": { "Strategy": "LendAndBorrow", "BorrowLimit": 100 } }'
Vérification des ressources liées aux quotas
# Check ClusterQueue kubectl get clusterqueues kubectl describe clusterqueueQUEUE_NAME# Check ResourceFlavors kubectl get resourceflavor kubectl describe resourceflavorFLAVOR_NAME