As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Cotas para o endpoint rocho-mantle
O bedrock-mantle. endpoint serve a API de OpenAI respostas, a API de conclusão de OpenAI bate-papo e a API de mensagens antrópicas. O tráfego de inferência para esse endpoint é controlado por um conjunto separado de cotas do endpoint. region.api.awsbedrock-runtime
Você pode visualizar as bedrock-mantle cotas no console Service Quotas selecionando Amazon Bedrock como serviço e pesquisando por Bedrock Mantle. Para solicitar um aumento em qualquer uma dessas cotas, consulteSolicitar um aumento de cota.
Tipos de cota
A inferência no bedrock-mantle endpoint é governada por duas cotas por modelo:
| Quota | Escopo | Description |
|---|---|---|
Tokens de entrada do Bedrock Mantle por minuto para ${model} |
Por modelo, por região | O número máximo de tokens de entrada por minuto que sua conta pode enviar ao modelo no bedrock-mantle endpoint. Compartilhado em todas as APIs atendidas pelo endpoint desse modelo. |
Tokens de saída do Bedrock Mantle por minuto para ${model} |
Por modelo, por região | O número máximo de tokens de saída por minuto que o modelo pode gerar para sua conta no bedrock-mantle endpoint. Compartilhado em todas as APIs atendidas pelo endpoint desse modelo. |
nota
Os tokens de entrada em cache lidos por meio do cache imediato não contam na cota de tokens de entrada por minuto.
nota
O bedrock-mantle endpoint não impõe cotas de solicitações por minuto (RPM). A limitação é regida exclusivamente pelas cotas de token de entrada e saída descritas nesta seção.
Como as solicitações são avaliadas em relação às cotas
Quando você envia uma solicitação de inferência para o bedrock-mantle endpoint, AWS avalia-a em relação às suas cotas na seguinte ordem:
-
Tokens de entrada por minuto — O número de tokens de entrada na solicitação, mais o valor de
max_tokens(ou o máximo específico do modelo, se não estiver definido),max_tokensé verificado em relação à cota de tokens de entrada por minuto do modelo solicitado. Se a admissão da solicitação exceder a cota, a solicitação será limitada com uma resposta HTTP 429. -
Tokens de saída por minuto — Conforme o modelo transmite ou gera saída, os tokens de saída são contabilizados em relação à cota de tokens de saída por minuto desse modelo. Se a cota for atingida durante a geração, a geração será interrompida e a resposta será retornada com um motivo de término indicando o limite.
Depois que a resposta for concluída, qualquer parte não utilizada da reserva inicial do token de entrada (a diferença entre max_tokens e a saída real) será reabastecida de acordo com sua cota.
O endpoint pode aplicar uma limitação de taxa interna adicional que não esteja exposta nas Service Quotas. Use a lógica de repetição com recuo exponencial para lidar com a limitação transitória.
As cotas de TPM do bedrock-runtime endpoint contam os tokens de entrada e saída juntos em uma única cota por modelo, enquanto o bedrock-mantle endpoint aplica cotas separadas de tokens de entrada por minuto e tokens de saída por minuto. Se você executa cargas de trabalho em ambos os endpoints, planeje a capacidade de cada endpoint de forma independente. Para obter detalhes sobre as cotas do endpoint de tempo de execução, consulte. Cotas para o endpoint de tempo de execução básico
Valores de cota padrão
A tabela a seguir lista as cotas padrão para modelos no bedrock-mantle endpoint. Os novos Contas da AWS podem receber cotas reduzidas, e as cotas podem variar de acordo com a região.
| Modelo | Entrada padrão TPM | Saída padrão TPM |
|---|---|---|
| AnthropicClaude Opus 4.7 | 20.000.000 | 4.000.000 |
Modelos adicionais serão listados nesta tabela à medida que forem lançados no endpoint.
Modelos sem cotas publicadas do TPM
O bedrock-mantle endpoint impõe cotas publicadas do TPM somente para os modelos listados na tabela acima. Atualmente, outros modelos servidos nesse endpoint não têm cotas de TPM por conta expostas nas Cotas de Serviço — sua taxa de transferência é governada pela capacidade interna do serviço. AWS pode introduzir cotas por conta para modelos adicionais como escalas de uso. Use a lógica de repetição com recuo exponencial para lidar com a limitação transitória. Se você precisar de uma cota publicada para um modelo específico, entre em contato com o AWS Support.
Regiões aceitas
bedrock-mantleas cotas são visíveis em Service Quotas nas AWS mesmas regiões em que bedrock-mantle o endpoint está disponível. Para ver a lista completa de regiões e URLs de endpoints, consulte. Regiões e endpoints compatíveis
Solicitar um aumento de cota
bedrock-mantleAs cotas estão visíveis nas Cotas de Serviço, mas as solicitações de aumento de cotas não são processadas atualmente por meio do console de Cotas de Serviço. Para solicitar um aumento, envie uma solicitação por meio do formulário de aumento do limite do AWS Support
-
O endpoint (
bedrock-mantle). -
A região da .
-
O modelo.
-
O nome da cota (TPM de entrada ou TPM de saída) e o valor que você está solicitando.
Você pode solicitar aumentos nos tokens de entrada por minuto e nos tokens de saída por minuto para o mesmo modelo em um único caso de suporte. A aprovação depende se seu uso atual justifica o aumento, portanto, inclua informações de uso recentes do console Service Quotas CloudWatch ou do console Service Quotas em sua solicitação.
Diferenças das cotas de tempo de execução básico
As bedrock-mantle cotas são independentes das bedrock-runtime cotas. Tráfego para bedrock-runtime. e tráfego para region.amazonaws.com.rproxy.govskope.cabedrock-mantle. consumir alocações de cotas separadas, mesmo ao chamar o mesmo modelo subjacente.region.api.aws
As cotas personalizadas do perfil de inferência, as cotas de inferência em lote e as alocações de taxa de transferência provisionada se aplicam somente ao endpoint e não são expostas no bedrock-runtime endpoint. bedrock-mantle