View a markdown version of this page

Alvos de inferência - Amazon Bedrock AgentCore

Alvos de inferência

Você pode adicionar alvos de inferência ao seu gateway para rotear o tráfego LLM para provedores de modelos. O gateway atua como uma camada de proxy LLM unificada, permitindo que os clientes se conectem a um único endpoint e roteiem as solicitações para o provedor de modelo correto com base no modelo especificado na solicitação. Os alvos de inferência fornecem roteamento baseado em modelos, abstração de credenciais e governança centralizada para o tráfego LLM em vários provedores.

Adicionar alvos de inferência ao seu gateway é útil quando você deseja:

  • Forneça um único endpoint que encaminhe para vários provedores de modelos (como Amazon Bedrock, OpenAI, Anthropic ou outros OpenAI-compatible serviços) sem exigir que os clientes gerenciem configurações específicas do provedor.

  • Gerenciamento abstrato de credenciais para que os clientes se autentiquem no gateway enquanto o gateway se autentica nos provedores em seu nome.

  • Aplique a governança centralizada por meio do Amazon Bedrock Guardrails e da Amazon AgentCore Bedrock Policy de forma consistente em todas as chamadas de LLM, independentemente do provedor.

  • Use o OpenAI SDK ou o Anthropic SDK diretamente com o endpoint do gateway, alternando entre os modelos alterando a string do modelo.

  • Liste os modelos disponíveis em todos os provedores configurados por meio de um único endpoint agregado.

Os alvos de inferência usam a inference chave na configuração do alvo. Você pode configurar um alvo de inferência de duas maneiras:

  • Conector — Zero-configuration configuração para fornecedores de modelos compatíveis. Recomendado para a maioria dos casos de uso.

  • Provedor — Controle explícito sobre o endpoint, mapeamentos de modelos e operações. Use quando precisar personalizar o comportamento de roteamento.

Os tópicos a seguir descrevem cada tipo de configuração em detalhes.