View a markdown version of this page

Quotas pour la limite entre le substrat rocheux et le manteau - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Quotas pour la limite entre le substrat rocheux et le manteau

Le bedrock-mantle.region.api.aws point de terminaison sert l'API OpenAI Responses, l'API OpenAI Chat Completions et l'API Anthropic Messages. Le trafic d'inférence vers ce point de terminaison est régi par un ensemble de quotas distinct de celui du point de bedrock-runtime terminaison.

Vous pouvez consulter les bedrock-mantle quotas dans la console Service Quotas en sélectionnant Amazon Bedrock comme service et en recherchant Bedrock Mantle. Pour demander une augmentation de l'un de ces quotas, consultezDemande d’augmentation de quota.

Types de quotas

L'inférence sur le bedrock-mantle point de terminaison est régie par deux quotas par modèle :

quotas par modèle de manteau rocheux
Quota Scope Description
Jetons d'entrée Bedrock Mantle par minute pour ${model} Par modèle, par région Le nombre maximum de jetons d'entrée par minute que votre compte peut envoyer au modèle sur le bedrock-mantle terminal. Partagé entre toutes les API desservies par le point de terminaison pour ce modèle.
Bedrock Mantle produit des jetons par minute pour ${model} Par modèle, par région Le nombre maximum de jetons de sortie par minute que le modèle peut générer pour votre compte sur le bedrock-mantle terminal. Partagé entre toutes les API desservies par le point de terminaison pour ce modèle.
Note

Les jetons d'entrée mis en cache lus via la mise en cache rapide ne sont pas pris en compte dans le quota de jetons d'entrée par minute.

Note

Le bedrock-mantle point de terminaison n'applique pas de quotas de demandes par minute (RPM). La régulation est régie uniquement par les quotas de jetons d'entrée et de sortie décrits dans cette section.

Comment les demandes sont évaluées par rapport aux quotas

Lorsque vous soumettez une demande d'inférence au bedrock-mantle point de terminaison, AWS évaluez-la par rapport à vos quotas dans l'ordre suivant :

  1. Jetons d'entrée par minute — Le nombre de jetons d'entrée dans la demande, plus la valeur de max_tokens (ou le maximum spécifique au modèle s'il n'max_tokensest pas défini), est vérifié par rapport au quota de jetons d'entrée par minute pour le modèle demandé. Si l'admission de la demande dépasse le quota, la demande est limitée par une réponse HTTP 429.

  2. Jetons de sortie par minute — Lorsque le modèle diffuse ou génère une sortie, les jetons de sortie sont comptabilisés dans le quota de jetons de sortie par minute pour ce modèle. Si le quota est atteint pendant la génération, celle-ci s'arrête et la réponse est renvoyée avec un motif de fin indiquant la date limite.

Une fois la réponse terminée, toute portion inutilisée de la réservation initiale de jetons d'entrée (la différence entre le jeton d'entrée max_tokens et le résultat réel) est réapprovisionnée selon votre quota.

Le terminal peut appliquer une limite de débit interne supplémentaire qui n'est pas indiquée dans les Quotas de Service. Utilisez la logique des nouvelles tentatives avec recul exponentiel pour gérer la régulation transitoire.

Les quotas TPM du bedrock-runtime point de terminaison comptabilisent les jetons d'entrée et de sortie ensemble par rapport à un quota unique par modèle, tandis que le bedrock-mantle point de terminaison applique des quotas de jetons d'entrée par minute et de jetons de sortie distincts par minute. Si vous exécutez des charges de travail sur les deux terminaux, planifiez la capacité de chaque point de terminaison indépendamment. Pour plus de détails sur les quotas du point de terminaison d'exécution, consultezQuotas pour le point de terminaison entre le socle et le temps d'exécution.

Valeurs de quota par défaut

Le tableau suivant répertorie les quotas par défaut pour les modèles sur le bedrock-mantle terminal. Les nouveaux Comptes AWS arrivants peuvent bénéficier de quotas réduits, et les quotas peuvent varier d'une région à l'autre.

Quotas de substrat rocheux par défaut par modèle
Modèle TPM d'entrée par défaut TPM de sortie par défaut
AnthropicClaude Opus 4.7 20 000 000 4 000 000

Les modèles supplémentaires seront répertoriés dans ce tableau au fur et à mesure de leur lancement sur le terminal.

Modèles sans quotas TPM publiés

Le bedrock-mantle point de terminaison applique les quotas TPM publiés uniquement pour les modèles répertoriés dans le tableau ci-dessus. Les autres modèles proposés sur ce point de terminaison ne disposent pas de quotas TPM par compte présentés dans les Quotas de Service aujourd'hui. Leur débit est régi par la capacité du service interne. AWS pourrait introduire des quotas par compte pour des modèles supplémentaires au fur et à mesure des échelles d'utilisation. Utilisez la logique des nouvelles tentatives avec recul exponentiel pour gérer la régulation transitoire. Si vous avez besoin d'un quota publié pour un modèle spécifique, contactez le AWS Support.

Régions prises en charge

bedrock-mantleles quotas sont visibles dans les Quotas de Service dans les mêmes AWS régions où le bedrock-mantle point de terminaison est disponible. Pour obtenir la liste complète des régions et des URL de point de terminaison, consultezRégions et points de terminaison pris en charge.

Demande d’augmentation de quota

Les bedrock-mantle quotas sont visibles dans Service Quotas, mais les demandes d'augmentation de quota ne sont actuellement pas traitées via la console Service Quotas. Pour demander une augmentation, soumettez une demande via le formulaire d'augmentation de la limite de AWS support et sélectionnez Amazon Bedrock comme service. Dans votre demande, spécifiez :

  • Le point de terminaison (bedrock-mantle).

  • La région .

  • Le modèle.

  • Le nom du quota (TPM d'entrée ou TPM de sortie) et la valeur que vous demandez.

Vous pouvez demander l'augmentation des jetons d'entrée par minute et des jetons de sortie par minute pour le même modèle dans un seul dossier de support. L'approbation dépend du fait que votre utilisation existante justifie l'augmentation. Vous devez donc inclure les informations d'utilisation récentes provenant de la console Service Quotas CloudWatch ou de la console Service Quotas dans votre demande.

Différences par rapport aux quotas d'exécution du socle

Les bedrock-mantle quotas sont indépendants des bedrock-runtime quotas. Trafic à bedrock-runtime.region.amazonaws.com destination et à destination bedrock-mantle.region.api.aws des allocations de quotas distinctes, même en cas d'appel au même modèle sous-jacent.

Les quotas de profil d'inférence personnalisés, les quotas d'inférence par lots et les allocations de débit provisionné s'appliquent uniquement au point de bedrock-runtime terminaison et ne sont pas exposés sur le point de terminaison. bedrock-mantle