View a markdown version of this page

Administración de dispositivos GPU de NVIDIA en Amazon EKS - Amazon EKS

Ayude a mejorar esta página

Para contribuir a esta guía del usuario, elija el enlace Edit this page on GitHub que se encuentra en el panel derecho de cada página.

Administración de dispositivos GPU de NVIDIA en Amazon EKS

Las GPU NVIDIA se utilizan ampliamente para el entrenamiento de machine learning, la inferencia y las cargas de trabajo informáticas de alto rendimiento. Amazon EKS admite dos mecanismos para administrar los dispositivos de GPU NVIDIA en los clústeres de EKS: el controlador de DRA de NVIDIA para las GPU y el complemento para dispositivos de Kubernetes de NVIDIA.

Recomendamos utilizar los controladores de DRA para las nuevas implementaciones con las versiones 1.34 y posteriores de Kubernetes cuando se utilice el aprovisionamiento de capacidad estática en Karpenter, grupos de nodos administrados de EKS o nodos autoadministrados. Actualmente, el modo automático de EKS no es compatible con DRA. El controlador de DRA de NVIDIA permite la asignación flexible de la GPU y el uso compartido de la GPU entre contenedores.

Para conocer la disponibilidad de las características de DRA en EKS, consulte Notas de la versión para Kubernetes para EKS. Para obtener más información sobre el uso del controlador de DRA de NVIDIA y el complemento para dispositivos con EKS, consulte Uso del controlador de DRA o el complemento para dispositivos de NVIDIA en Amazon EKS.

Uso compartido de GPU (MIG y segmentación de tiempo)

GPU de varias instancias (MIG)

GPU de varias instancias (MIG) es una característica de hardware de GPU de NVIDIA que divide una sola GPU física en varias instancias aisladas. El número máximo de instancias depende de la GPU. Las GPU de centros de datos, como A100, H100, H200 y B200, admiten hasta siete instancias, mientras que las GPU g7 y g7e basadas en Blackwell admiten menos. Cada instancia tiene memoria dedicada, unidades de computación y ancho de banda de memoria, por lo que una carga de trabajo que se ejecuta en una instancia no puede afectar a la carga de trabajo en otra. A diferencia de la segmentación temporal, en la que se comparte una GPU mediante la multiplexación temporal por software sin aislamiento, MIG proporciona aislamiento de errores y memoria por hardware entre pods.

MIG se adapta mejor a la inferencia con varios inquilinos, a las cargas de trabajo que requieren una calidad de servicio predecible y a los entornos con requisitos de cumplimiento para la tenencia con hardware aislado. Está disponible en las GPU de NVIDIA Ampere (A100), Hopper (H100 y H200) y Blackwell. En AWS, estos son los tipos de instancias de la familia P y los tipos de instancias g7 y g7e basados en Blackwell.

Para obtener más información y los pasos para usar MIG con las GPU de NVIDIA y EKS, consulte Uso de GPU de varias instancias (MIG) con GPU de NVIDIA en Amazon EKS.

Segmentación temporal

La segmentación temporal permite que varios pods compartan una sola GPU de NVIDIA física mediante la configuración del complemento para dispositivos de NVIDIA o del controlador de DRA para que anuncie más de una ranura programable por GPU. El programador de Kubernetes coloca varios pods en la misma GPU y el programador de CUDA de la GPU multiplexa en el tiempo las cargas de trabajo.

La segmentación temporal es la estrategia más sencilla para compartir la GPU. Utiliza solo software, no requiere hardware especial y funciona en todos los tipos de instancias de GPU de NVIDIA en AWS. La segmentación temporal no aísla la memoria ni la computación entre los pods que comparten una GPU. Es ideal para cargas de trabajo que utilizan poco la GPU, como los servicios de inferencia que están inactivos entre solicitudes o los entornos de desarrollo en los que varios usuarios comparten una GPU. Para las cargas de trabajo que requieren aislamiento de memoria y computación por hardware, utilice MIG en su lugar.

Para obtener más información y los pasos para usar segmentación temporal con las GPU de NVIDIA y EKS, consulte Uso de la segmentación temporal con GPU de NVIDIA en Amazon EKS.

Temas