As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Inferência global entre regiões
A inferência global entre regiões estende a inferência entre regiões além dos limites geográficos, permitindo o roteamento de solicitações de inferência para empresas suportadas em todo o mundo. Regiões da AWS
Benefícios da inferência global entre regiões
Com a inferência global entre regiões para o modelo Anthropic Claude Sonnet 4.5, você obtém as seguintes vantagens em relação a um perfil geográfico de inferência entre regiões:
-
Cost-efficiency— Você economiza aproximadamente 10% nos preços dos tokens de entrada e saída em comparação com a inferência geográfica entre regiões. O Amazon Bedrock calcula o preço com base no local a Região da AWS partir do qual você faz a solicitação (a fonte Região da AWS).
-
Monitoramento simplificado — ao usar a inferência global entre regiões, CloudTrail continue registrando entradas de registro em sua fonte Região da AWS, simplificando a observabilidade CloudWatch e o gerenciamento. Mesmo que suas solicitações sejam processadas em diferentes países do Regiões da AWS mundo, você mantém uma visão centralizada do desempenho e dos padrões de uso do seu aplicativo por meio de suas ferramentas de AWS monitoramento conhecidas.
-
Roteamento de solicitações em todo o mundo — Com a inferência global entre regiões, suas solicitações podem ser processadas por computação em todas as áreas comerciais suportadas em todo o Regiões da AWS mundo, em vez de dentro de uma única geografia.
Considerações globais sobre inferência entre regiões
Observe as seguintes informações sobre a inferência global entre regiões:
-
Para obter cotas de produtividade padrão entre regiões ao usar perfis de inferência globais, consulte as solicitações de inferência do Cross-region modelo global por minuto para $ {Model} e os tokens de inferência do Cross-region modelo global por minuto para valores de $ {Model} nas cotas de serviço Amazon Bedrock na Referência geral. AWS
Você pode solicitar, visualizar e gerenciar cotas para o Perfil de Cross-Region Inferência Global no console de cotas de serviço
ou usando comandos da AWS CLI em sua região de origem.
Requisitos de política do IAM para inferência global entre regiões
Para habilitar a inferência global entre regiões para seus usuários, você deve aplicar uma política de IAM em três partes à função. Veja a seguir um exemplo de política de IAM para fornecer controle granular. Você pode substituir <REQUESTING REGION> a política de exemplo pela política em Região da AWS que você está operando.
{ "Version": "2012-10-17", "Statement": [ { "Sid": "GrantGlobalCrisInferenceProfileRegionAccess", "Effect": "Allow", "Action": "bedrock:InvokeModel", "Resource": [ "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.<MODEL NAME>" ], "Condition": { "StringEquals": { "aws:RequestedRegion": "<REQUESTING REGION>" } } }, { "Sid": "GrantGlobalCrisInferenceProfileInRegionModelAccess", "Effect": "Allow", "Action": "bedrock:InvokeModel", "Resource": [ "arn:aws:bedrock:<REQUESTING REGION>::foundation-model/<MODEL NAME>" ], "Condition": { "StringEquals": { "aws:RequestedRegion": "<REQUESTING REGION>", "bedrock:InferenceProfileArn": "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.<MODEL NAME>" } } }, { "Sid": "GrantGlobalCrisInferenceProfileGlobalModelAccess", "Effect": "Allow", "Action": "bedrock:InvokeModel", "Resource": [ "arn:aws:bedrock:::foundation-model/<MODEL NAME>" ], "Condition": { "StringEquals": { "aws:RequestedRegion": "unspecified", "bedrock:InferenceProfileArn": "arn:aws:bedrock:<REQUESTING REGION>:<ACCOUNT>:inference-profile/global.<MODEL NAME>" } } } ] }
A primeira parte da política concede acesso ao perfil de inferência regional em sua solicitação Região da AWS. A segunda parte fornece acesso ao recurso regional de FM. A terceira parte concede acesso ao recurso global de FM, que permite a capacidade de roteamento entre regiões.
Ao implementar essas políticas, inclua todos os três recursos Amazon Resource Names (ARNs) em suas declarações do IAM:
-
O perfil de inferência regional ARN segue o padrão.
arn:aws:bedrock:REGION:ACCOUNT:inference-profile/global.MODEL-NAMEUse esse ARN para conceder acesso ao perfil de inferência global na fonte. Região da AWS -
O Regional FM usa
arn:aws:bedrock:REGION::foundation-model/MODEL-NAME. Use esse ARN para conceder acesso ao FM na fonte Região da AWS. -
O FM global exige
arn:aws:bedrock:::foundation-model/MODEL-NAME. Use esse ARN para conceder acesso ao FM em diferentes globais Regiões da AWS.
O ARN FM global não tem nenhuma Região da AWS conta especificada, o que é intencional e necessário para a funcionalidade entre regiões.
Desativar a inferência global entre regiões
Você pode escolher entre duas abordagens principais para implementar políticas de negação no CRIS global para funções específicas do IAM, cada uma com diferentes casos de uso e implicações:
-
Remover uma política do IAM — O primeiro método envolve a remoção de uma ou mais das três políticas de IAM necessárias das permissões do usuário. Como o CRIS global exige que todas as três políticas funcionem, a remoção de uma política resultará na negação do acesso.
-
Implemente uma política de negação — A segunda abordagem é implementar uma política de negação explícita que vise especificamente os perfis globais de inferência do CRIS. Esse método fornece uma documentação clara de sua intenção de segurança e garante que, mesmo que alguém acidentalmente adicione as políticas de permissão necessárias posteriormente, a negação explícita tenha precedência. A política de negação deve usar uma
StringEqualscondição que corresponda ao padrão"aws:RequestedRegion": "unspecified". Esse padrão visa especificamente perfis de inferência com oglobalprefixo.
Ao implementar políticas de negação, é crucial entender que o CRIS global muda a forma como o aws:RequestedRegion campo se comporta. As políticas Região da AWS tradicionais de negação que usam StringEquals condições com Região da AWS nomes específicos, como as, não "aws:RequestedRegion":
"us-west-2" funcionarão conforme o esperado com o CRIS global. O serviço define esse campo comoglobal, em vez do destino real Região da AWS. No entanto, conforme mencionado anteriormente, "aws:RequestedRegion": "unspecified" resultará no efeito de negação.
Requisitos da política de controle de serviços para inferência global entre regiões
Para inferência global entre regiões, se a política de segurança da sua organização usa SCPs para bloquear regiões não utilizadas, você deve atualizar as condições de SCP específicas da região para permitir o acesso com. "aws:RequestedRegion": "unspecified" Essa condição é específica da inferência global entre regiões da Amazon Bedrock e garante que as solicitações possam ser encaminhadas para todas as regiões comerciais suportadas. AWS
O exemplo de SCP a seguir bloqueia todas as chamadas de AWS API fora das regiões aprovadas e, ao mesmo tempo, permite chamadas de inferência entre regiões globais da Amazon Bedrock que são usadas "unspecified" como região para roteamento global:
{ "Version": "2012-10-17", "Statement": [ { "Sid": "DenyAllOutsideApprovedRegions", "Effect": "Deny", "Action": "*", "Resource": "*", "Condition": { "StringNotEquals": { "aws:RequestedRegion": [ "us-east-1", "us-east-2", "us-west-2", "unspecified" ] } } } ] }
Desativar a inferência global entre regiões
As organizações com requisitos de residência ou conformidade de dados devem avaliar se a inferência global entre regiões se encaixa em sua estrutura de conformidade, já que as solicitações podem ser processadas em outras regiões comerciais compatíveis AWS . Para desativar explicitamente a inferência global entre regiões, implemente a seguinte política de SCP:
{ "Effect": "Deny", "Action": "bedrock:*", "Resource": "*", "Condition": { "StringEquals": { "aws:RequestedRegion": "unspecified" }, "ArnLike": { "bedrock:InferenceProfileArn": "arn:aws:bedrock:*:*:inference-profile/global.*" } } }
Esse SCP nega explicitamente a inferência global entre regiões porque o "aws:RequestedRegion" is "unspecified" e a "ArnLike" condição têm como alvo os perfis de inferência com o prefixo no ARN. global
AWS Implantação da torre de controle
A edição manual de SCPs gerenciados pela AWS Control Tower é altamente desencorajada, pois pode causar desvios. Em vez disso, use os mecanismos fornecidos pela Control Tower para gerenciar essas exceções. Os princípios fundamentais envolvem estender os controles existentes de negação de regiões ou habilitar regiões e, em seguida, aplicar uma política de bloqueio condicional personalizada.
Para obter orientações detalhadas e detalhadas sobre a implementação da inferência entre regiões com a Control Tower, consulte a postagem do blog Habilitar a inferência entre regiões do Amazon Bedrock em ambientes com várias contas.
Aumentos do limite de solicitações para inferência global entre regiões
Ao usar perfis globais de inferência do CRIS, você pode usar o CRIS global de mais de 20 fontes suportadas. Regiões da AWS Esse é um limite global. Para visualizar, gerenciar ou aumentar as cotas para perfis globais de inferência entre regiões, use o console de cotas de serviço ou a AWS CLI na fonte solicitada. Região da AWS
Conclua as etapas a seguir para solicitar um aumento de limite:
-
Faça login no console de cotas de serviço em sua AWS conta.
-
No painel de navegação, escolha Serviços da AWS .
-
Na lista de serviços, encontre e escolha Amazon Bedrock.
-
Na lista de cotas do Amazon Bedrock, use o filtro de pesquisa para encontrar as cotas globais específicas do CRIS. Por exemplo:
-
Tokens de inferência de modelos globais entre regiões por minuto para o Anthropic Claude Sonnet 4.5 V1
-
-
Selecione a cota que você deseja aumentar.
-
Escolha Solicitar aumento no nível da conta.
-
Insira o novo valor de cota desejado.
-
Escolha Solicitar para enviar sua solicitação.
Ao calcular o aumento de cota necessário, considere a taxa de esgotamento. A taxa de burndown é a taxa na qual os tokens de entrada e saída são convertidos em uso da cota de tokens para o sistema de limitação. Os modelos a seguir têm uma taxa de queima de 5x para tokens de saída (1 token de saída consome 5 tokens de suas cotas):
-
Claude antrópico Opus 4
-
Soneto antrópico de Claude 4.5
-
Soneto antrópico de Claude 4
-
Soneto antrópico Claude 3.7
Para todos os outros modelos, a taxa de burndown é de 1:1 (um token de saída consome um token da sua cota). Para tokens de entrada, a proporção entre token e cota é de 1:1. O cálculo do número total de tokens por solicitação é o seguinte:
Input token count + Cache write input tokens + (Output token count x
Burndown rate)
Use a inferência global entre regiões
Para usar a inferência global entre regiões com o Claude Sonnet 4.5 da Anthropic, os desenvolvedores devem concluir as seguintes etapas principais:
-
Use o ID do perfil de inferência global — Ao fazer chamadas de API para o Amazon Bedrock, especifique o ID do perfil de inferência Claude Sonnet 4.5 global da Anthropic (
global.anthropic.claude-sonnet-4-5-20250929-v1:0) em vez de um ID de modelo específico. Região da AWS -
Configurar permissões do IAM — Conceda permissões de IAM apropriadas para acessar o perfil de inferência e as FMs no destino potencial. Regiões da AWS
A inferência global entre regiões é suportada para:
-
On-demand inferência de modelo
-
Inferência em lote
-
Agentes
-
Avaliação de modelos
-
gerenciamento de prompts
-
Fluxos rápidos
nota
O perfil de inferência global é compatível com inferência de On-demand modelos, inferência em lote, agentes, avaliação de modelos, gerenciamento de solicitações e fluxos de solicitações.
Implemente inferência global entre regiões
A implementação da inferência global entre regiões com o Claude Sonnet 4.5 da Anthropic é simples, exigindo apenas algumas alterações no código de seu aplicativo existente. Veja a seguir um exemplo de como atualizar seu código em Python:
import boto3 import json bedrock = boto3.client('bedrock-runtime', region_name='us-east-1') model_id = "global.anthropic.claude-sonnet-4-5-20250929-v1:0" response = bedrock.converse( messages=[{"role": "user", "content": [{"text": "Explain cloud computing in 2 sentences."}]}], modelId=model_id, ) print("Response:", response['output']['message']['content'][0]['text']) print("Token usage:", response['usage']) print("Total tokens:", response['usage']['totalTokens'])