View a markdown version of this page

Camada 1: Criação de infraestrutura confiável de dados e computação para IA generativa - AWS Recomendações

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Camada 1: Criação de infraestrutura confiável de dados e computação para IA generativa

Para desenvolver aplicativos generativos de IA, especialmente se for necessário treinar ou ajustar um modelo básico, uma base de dados e uma infraestrutura de computação robustas são essenciais. À medida que as empresas embarcam em sua jornada generativa de IA, elas precisam de uma infraestrutura que possa suportar todo o ciclo de vida do aprendizado de máquina. Eles também precisam encontrar o equilíbrio certo entre desempenho, custo e eficiência operacional.

A infraestrutura confiável de IA generativa deve oferecer os seguintes três componentes principais: a infraestrutura básica, a infraestrutura de armazenamento e recuperação vetorial e a infraestrutura computacional. Juntos, esses componentes fornecem a flexibilidade de atender às necessidades de qualquer projeto, independentemente de sua escala, requisitos ou ambiente.

Infraestrutura básica para implementações baseadas em API

A maioria das organizações inicia sua jornada de IA generativa usando modelos básicos pré-treinados por meio de. APIs O Amazon Bedrock fornece acesso sem servidor aos principais modelos básicos por meio de uma API unificada. Isso ajuda você a experimentar e implantar aplicativos generativos de IA sem gerenciar uma infraestrutura complexa. Para essas implementações, você precisa do seguinte:

Infraestrutura de armazenamento e recuperação de vetores

À medida que seus aplicativos de IA generativa amadurecem, você provavelmente precisará aprimorá-los com conhecimento e contexto específicos do domínio. Com o Retrieval Augmented Generation (RAG), o modelo básico faz referência a uma fonte de dados autorizada que está fora de suas fontes de dados de treinamento, como dados ou documentos da sua organização, antes de gerar uma resposta. Para obter mais informações, consulte Opções e arquiteturas de geração aumentada de recuperação em. AWS

O Amazon Bedrock Knowledge Bases fornece uma solução totalmente gerenciada para criar aplicativos RAG. Ele ajuda você a conectar com segurança seus dados corporativos aos modelos básicos. Para maior flexibilidade, você pode usar o Amazon OpenSearch Service com recursos de pesquisa vetorial ou pode usar o Amazon Relational Database Service (Amazon RDS) para PostgreSQL com a extensão pgvector para armazenar incorporações vetoriais.

Para operações vetoriais eficientes, considere usar instâncias otimizadas para computação do Amazon EC2 para geração de incorporação. Considere também armazenar em cache as incorporações acessadas com frequência usando ElastiCache a Amazon para otimizar o desempenho e reduzir custos.

Para obter mais informações sobre bancos de dados vetoriais e armazenamento em cache, consulte O que é um banco de dados vetoriais? e Escolha de um banco de dados AWS vetoriais para casos de uso do RAG.

Infraestrutura de computação de alto desempenho para treinamento e ajuste fino de modelos

Para organizações que estão prontas para personalizar modelos básicos, AWS oferece uma infraestrutura abrangente para treinamento e ajuste fino de modelos. Você pode usar o Amazon Simple Storage Service (Amazon S3) como armazenamento de objetos de baixo custo, escalável e altamente durável para criar plataformas de dados e armazenar dados de treinamento e modelos treinados. Além disso, AWS Glueé um serviço de integração de dados sem servidor que pode ajudá-lo a preparar dados para o treinamento de modelos.

Para a infraestrutura de treinamento, a Amazon SageMaker AI oferece um ambiente de aprendizado de máquina totalmente gerenciado com as ferramentas e os fluxos de trabalho necessários para criar, treinar e implantar modelos. Usar a SageMaker IA pode reduzir significativamente sua sobrecarga operacional. Considere o uso de instâncias de computação acelerada, como as famílias de instâncias G e P. Essas famílias de instâncias fornecem acesso às últimas novidades GPUs da NVIDIA para treinamento e inferência de aprendizado de máquina. Você também pode usar AWS Trainiumum acelerador de aprendizado de máquina desenvolvido especificamente para acelerar os tempos de treinamento em até 50% e, ao mesmo tempo, reduzir os custos.

Para projetos realmente grandes, você pode usar o Amazon EC2 UltraClusters. UltraClusters consistem em milhares de instâncias aceleradas do Amazon EC2 que estão co-localizadas em uma AWS determinada zona de disponibilidade e interconectadas. UltraClusters podem ser escalados para milhares GPUs ou aceleradores de aprendizado de máquina. Eles oferecem operações de ponto flutuante por segundo (exaflops) de capacidade computacional agregada, o que reduz o tempo de treinamento e pode ser reduzido de semanas para alguns dias. time-to-solution

Recomendações de implementação

Considere as recomendações a seguir para configurar uma infraestrutura escalável e econômica para seus projetos de IA generativa:

  • Para experimentação rápida e implantações iniciais, comece com o Amazon Bedrock e use instâncias de computação de uso geral para seus aplicativos.

  • Conforme suas necessidades evoluírem, implemente soluções de armazenamento vetorial usando o Amazon Bedrock Knowledge Bases ou o Amazon OpenSearch Service. Dimensione sua infraestrutura adequadamente.

  • Para personalização avançada, padronize e automatize o provisionamento de ambientes de aprendizado de máquina seguros e governados para atender aos requisitos de equipes distribuídas. Para obter mais informações, consulte Configuração de ambientes de aprendizado de máquina seguros e bem governados em AWS (postagem do AWS blog).

  • Adote operações de aprendizado de máquina (MLOps) para automatizar e padronizar processos em todo o ciclo de vida do aprendizado de máquina. Esses processos incluem desenvolvimento de modelos, testes, integração, lançamento e gerenciamento de infraestrutura. Para ter mais informações, consulte O que é o MLOps?

  • Para experimentos em pequena escala ou provas de conceitos, comece com a SageMaker IA da Amazon e as instâncias de computação de uso geral. Ao escalar para grandes implantações de produção, considere as instâncias de computação acelerada do Amazon EC2 para obter o máximo desempenho.

  • Use o treinamento local gerenciado em SageMaker IA para otimizar o custo dos modelos de treinamento em até 90% em comparação com instâncias sob demanda. SageMaker A IA gerencia as interrupções pontuais em seu nome.