As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Perfis de inferência de aplicações
Os perfis de inferência de aplicativos (AIPs) permitem atribuir os custos do Amazon Bedrock por aplicativo, equipe ou carga de trabalho às APIs Amazon Bedrock InvokeModel e https://docs.aws.amazon.com/bedrock/latest/APIReference/API_runtime_Converse.html Converse no endpoint. bedrock-runtime Cada AIP é específico do modelo e carrega etiquetas de alocação de custos que fluem para o Explorador de AWS Custos e Relatórios de Uso e AWS Custo (tanto o CUR clássico quanto o CUR 2.0).
Para cargas de trabalho usando respostas e conclusões de bate-papo no bedrock-mantle endpoint, use em vez disso. Projetos
Importante
Os perfis de inferência de aplicativos não são compatíveis com as APIs de respostas e de conclusão de bate-papo em nenhum dos terminais. Uma solicitação para essas APIs que nomeia um perfil de inferência de aplicativo como seu alvo de inferência é rejeitada com um erro 400. Use uma AIP com as APIs InvokeModel e Converse e atribua o uso de respostas e conclusões de bate-papo com ou em vez disso. Atribuição principal do IAM Per-request marcação de metadados Perfis de inferência de sistema, geográficos e globais funcionam normalmente com todas essas APIs.
Como funciona a atribuição de custos
Um perfil de inferência de aplicativo é um recurso que faz referência a um modelo específico do Amazon Bedrock. Você cria o perfil, anexa tags de alocação de custos e usa o ARN do perfil no lugar do ID do modelo em suas chamadas de API. As tags do perfil são anexadas ao registro de cobrança de cada solicitação.
O exemplo a seguir mostra como usar um ARN de perfil de inferência de aplicativo em vez de um ID de modelo ao chamar a API Converse:
import boto3 client = boto3.client("bedrock-runtime") response = client.converse( modelId="arn:aws:bedrock:us-east-1:123456789012:inference-profile/my-team-profile", messages=[ {"role": "user", "content": [{"text": "Hello"}]} ] )
Para obter mais informações sobre a criação de perfis, consulteCriar um perfil de inferência de aplicação.
nota
Os perfis de inferência de aplicativos fornecem dólares faturados agregados ao AWS Cost Explorer e ao CUR (CUR e CUR 2.0 clássicos). O grão mais fino é por tipo de uso por dia; eles não produzem por custo de solicitação. Para obter detalhes de token por solicitação, use Per-request marcação de metadados com seus registros de invocação de modelo.
Visualizando os custos do perfil
Depois de criar e marcar seus perfis, ative as tags como tags de alocação de custos no console AWS Billing and Cost Management:
-
Abra o console de gerenciamento AWS de cobrança e custos.
-
No painel de navegação, escolha Cost Allocation Tags (Tags de alocação de custo).
-
Selecione as tags que você aplicou aos seus perfis.
-
Selecione Ativar.
As tags podem levar até 24 horas para aparecer no Cost Explorer e no CUR após a ativação. As etiquetas de alocação de custos não são retroativas. Somente os custos incorridos após a ativação são marcados. Para obter mais informações, consulte Ativando tags de alocação de custos definidas pelo usuário.
Após a ativação da tag, você pode analisar os custos do Amazon Bedrock por perfil de inferência do aplicativo nas seguintes ferramentas:
-
AWS Explorador de custos — Filtre por tags de perfil para ver as tendências de custo ao longo do tempo. Agrupe por tag para comparar os custos entre os perfis.
-
AWS Relatórios de custo e uso — Consulte os dados do CUR para obter detalhamentos de custos de itens de linha por tag de perfil. As tags aparecem nas exportações clássicas do CUR e do CUR 2.0.
Considerações sobre dimensionamento
Cada perfil de inferência de aplicativo está vinculado a um modelo específico. Isso significa que você precisa de um perfil separado para cada combinação exclusiva de modelo, equipe e conjunto de tags. À medida que as organizações crescem, a contagem de perfis pode aumentar rapidamente, especialmente quando novas versões de modelos exigem novos perfis.
Para reduzir a proliferação de perfis:
-
Recomendado: Use Projetos para flexibilidade e facilidade ao rastrear custos.
-
Marque no nível da equipe ou do centro de custos, em vez de por usuário.
-
Para atribuição de custos por usuário sem criar perfis adicionais, use. Atribuição principal do IAM O rastreamento principal do IAM funciona automaticamente junto com perfis de inferência de aplicativos e custos de atributos no nível da identidade.
-
Para obter detalhes de token por solicitação, em vez de dólares agregados, use Per-request marcação de metadados com seus registros de invocação de modelo. Ele não precisa de recursos por modelo.