View a markdown version of this page

Endpoints compatíveis com o Amazon Bedrock - Amazon Bedrock

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Endpoints compatíveis com o Amazon Bedrock

O Amazon Bedrock oferece suporte a vários endpoints para realizar operações de inferência.

Operações de inferência

Para novos aplicativos, recomendamos o bedrock-runtime endpoint. Ele suporta as APIs Bedrock-native InvokeModel e Converse, as APIs OpenAI-compatible Responses and Chat Complements e a API Anthropic Messages, e é onde os recursos do Amazon Bedrock, como Guardrails, roteamento inteligente de prompts e inferência entre regiões, estão disponíveis. Encaminhe as solicitações de inferência do modelo entre Regiões da AWS com inferência entre regiões O Amazon Bedrock também oferece suporte a um segundo endpointbedrock-mantle, que atualmente oferece recursos adicionais, como uso de ferramentas pré-configuradas e do lado do servidor (incluindo pesquisa na web), inferência assíncrona e criação de projetos e espaços de trabalho. background=true Projetos (OpenAI-compatible) Espaços de trabalho () Anthropic-compatible Para ver qual endpoint cada modelo suporta, consulteDisponibilidade de endpoints por modelos.

Endpoint APIs compatíveis Descrição
bedrock-runtime.{region}.amazonaws.com (recomendado) InvokeModel/Converse//Conclusões de bate-papos//API de respostas//API de mensagens Region-specific endpoints para fazer solicitações de inferência para modelos hospedados no Amazon Bedrock usando as APIs. InvokeModel/Converse/Chat Completions/Responses/Messages Para obter mais informações sobre as Bedrock-native operações, consulte Operações da API Amazon Bedrock Runtime. As OpenAI-compatible APIs são chamadas nos /openai/v1 caminhos desse endpoint e não por meio dos AWS SDKs.
bedrock-mantle.{region}.api.aws API de respostas//API de conclusão de bate-papos//API de mensagens Region-specific endpoints para fazer solicitações de inferência para modelos hospedados no Amazon Bedrock usando os OpenAI-compatible endpoints e a API Anthropic Messages.

Os aplicativos existentes que usam bedrock-mantle continuam sendo totalmente suportados e não precisam ser alterados. Ambos os endpoints permitem que você leve uma base de código existente do SDK OpenAI para o Amazon Bedrock alterando somente a URL básica e a chave da API, e ambos suportam as APIs de OpenAI-compatible respostas e preenchimentos de bate-papo e a API de mensagens antrópicas.

As tabelas a seguir comparam o que está disponível em cada endpoint.

nota

A API Messages está disponível em ambos os endpoints, mas as duas superfícies não têm suporte a recursos idênticos. Em particular, as saídas estruturadas (o output_config.format parâmetro) não são suportadas em bedrock-mantle — as solicitações que incluem output_config.format são rejeitadas com um erro 400. Para usar saídas estruturadas com modelos Anthropic Claude, ative o Converse ou as APIs. InvokeModel bedrock-runtime

nota

A API de respostas também está disponível em ambos os endpoints sem suporte a recursos idênticos. Em bedrock-runtime:

  • As solicitações são sempre síncronas. background=trueé rejeitado com um erro 400. O store parâmetro não é afetado e mantém o padrão detrue, portanto, as conversas armazenadas em vários turnos funcionam normalmente.

  • Server-side o uso de ferramentas e as ferramentas pré-configuradas não estão disponíveis, incluindo pesquisa Pesquisa na Web na web. Client-side o uso da ferramenta funciona em ambos os terminais.

  • Somente o projeto padrão é suportado. Consulte Projetos (OpenAI-compatible).

  • Uma resposta armazenada pertence à pessoa Região da AWS que a forneceu. Recuperá-lo, cancelá-lo ou excluí-lo e continuar a conversa com previous_response_id ele são todos feitos por essa região.

nota

Ativadabedrock-runtime, a API de respostas atribui o uso somente pelo principal do IAM. Per-request a marcação de metadados e os perfis de inferência do aplicativo não estão disponíveis nele — uma solicitação que nomeia um perfil de inferência do aplicativo como seu alvo de inferência é rejeitada com um erro 400. Isso não afeta a inferência entre regiões: os perfis de inferência geográfica e global definidos pelo sistema funcionam normalmente.

Disponibilidade de recursos Bedrock
Recurso bedrock-runtime bedrock-mantle
Corrimãos
Armazenamento imediato em cache
Roteamento rápido inteligente
nota

O suporte imediato ao cache bedrock-mantle depende do modelo específico — consulte cada placa de modelo abaixo Modelos em resumo para obter detalhes.

Abordagem de taxa de transferência e cota

Cada endpoint usa uma abordagem diferente para gerenciar a taxa de transferência.

  • bedrock-runtime— Em muitos serviços multilocatários tradicionais, a arquitetura é projetada com base em cotas por conta para gerenciar o acesso justo aos recursos compartilhados. Essa é a abordagem usada combedrock-runtime. Cada modelo tem cotas de produtividade fixas (RPM e TPM) para as quais você pode solicitar aumentos. Para obter detalhes, consulte Cotas para o endpoint básico de tempo de execução.

  • bedrock-mantle— Esse endpoint é arquitetado com mecanismos avançados de agendamento e filas de trabalho que oferecem distribuição justa e, ao mesmo tempo, suportam limites de produtividade inicial mais altos. Esse design também permite bedrock-mantle hospedar um amplo conjunto de modelos e oferecer toda a gama de recursos disponíveis no catálogo de modelos. Na maioria dos casos, as solicitações são atendidas imediatamente. Em alguns casos, uma solicitação pode ser enfileirada brevemente enquanto as cargas de trabalho em andamento são concluídas e a taxa de transferência fica disponível. Para obter mais detalhes, consulte Cotas para o endpoint rocho-mantle e Práticas recomendadas de escalabilidade e produtividade.

Preços

Per-token o preço do mesmo modelo é idêntico em bedrock-runtime bedrock-mantle e. Escolha um endpoint com base nas APIs e nos recursos de que você precisa, não no custo. Para ver os preços atuais, consulte os preços https://aws.amazon.com/bedrock/pricing/ do Amazon Bedrock.

Quando escolher cada endpoint

Comece com bedrock-runtime quando você quiser:

Use bedrock-mantle quando quiser:

Os dois endpoints podem ser usados juntos no mesmo aplicativo — escolha por caso de uso.

Reduza os custos de saída de dados com endpoints de interface VPC

Se você estiver ligando para a Amazon Bedrock de dentro de uma VPC, considere usar endpoints de interface VPC (AWS PrivateLink) para manter o tráfego na rede da AWS e evitar cobranças de saída de dados associadas a gateways NAT ou gateways de internet.