Ajudar a melhorar esta página
Para contribuir com este guia de usuário, escolha o link Editar esta página no GitHub, disponível no painel direito de cada página.
Gerenciar GPUs da NVIDIA no Amazon EKS
As GPUs da NVIDIA são amplamente utilizadas para treinamento de machine learning, inferência e workloads de computação de alta performance. O Amazon EKS oferece suporte a dois mecanismos para gerenciar dispositivos de GPU NVIDIA em seus clusters do EKS: o driver NVIDIA DRA para GPUs e o plug-in de dispositivo NVIDIA para Kubernetes.
Recomendamos usar drivers DRA para novas implantações com as versões 1.34 e posteriores do Kubernetes ao usar o provisionamento de capacidade estática
Para ver a disponibilidade dos recursos de DRA no EKS, consulte as notas de lançamento das versões do Kubernetes para EKS. Para obter mais informações sobre como usar o plug-in de dispositivo e o driver NVIDIA DRA com o EKS, consulte Usar o plug-in de dispositivo ou driver do NVIDIA DRA no Amazon EKS.
Compartilhamento de GPU (MIG e fatiamento de tempo)
GPU de várias instâncias (MIG)
A GPU de várias instâncias (MIG) é um recurso de hardware nas GPUs da NVIDIA que particiona uma única GPU física em várias instâncias isoladas. O número máximo de instâncias depende da GPU. As GPUs de data center, como A100, H100, H200 e B200, são compatíveis com até sete instâncias, enquanto as GPUs g7 e g7e baseadas em Blackwell são compatíveis com menos. Cada instância tem memória dedicada, unidades de computação e largura de banda de memória, portanto, uma workload executada em uma instância não pode afetar a workload em outra. Ao contrário do fatiamento de tempo, que compartilha uma GPU por meio de multiplexação temporal por software sem isolamento, o MIG fornece memória no nível de hardware e isolamento de falhas entre pods.
O MIG é mais adequado para inferência multilocatária, workloads que exigem qualidade de serviço previsível e ambientes com requisitos de conformidade para locação isolada por hardware. Ele está disponível nas GPUs NVIDIA Ampere (A100), Hopper (H100 e H200) e Blackwell. Na AWS, esses são os tipos de instância da família P e os tipos de instância g7 e g7e baseados em Blackwell.
Para obter mais informações e as etapas para usar o MIG com GPUs da NVIDIA e o EKS, consulte Usar GPUs de várias instâncias (MIG) com GPUs da NVIDIA no Amazon EKS.
Fatiamento de tempo
O fatiamento de tempo permite que vários pods compartilhem uma única GPU da NVIDIA física configurando o plug-in de dispositivo da NVIDIA ou o driver DRA para anunciar mais de um slot programável por GPU. O agendador do Kubernetes coloca vários pods na mesma GPU, e o agendador do CUDA da GPU realiza a multiplexação temporal das workloads.
O fatiamento de tempo é a estratégia mais simples de compartilhamento de GPU. Ele usa apenas software, não requer hardware especial e funciona em todos os tipos de instância de GPU da NVIDIA na AWS. O fatiamento de tempo não oferece isolamento de memória ou computação entre pods que compartilham uma GPU. É melhor para workloads com baixa utilização de GPU, como serviços de inferência que ficam ociosos entre requisições ou ambientes de desenvolvimento em que vários usuários compartilham uma GPU. Para workloads que exigem memória no nível de hardware e isolamento computacional, use o MIG.
Para obter mais informações e as etapas para usar o fatiamento de tempo com GPUs da NVIDIA e o EKS, consulte Usar o fatiamento de tempo com GPUs da NVIDIA no Amazon EKS.