View a markdown version of this page

bedrock-mantle エンドポイントのクォータ - Amazon Bedrock

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

bedrock-mantle エンドポイントのクォータ

bedrock-mantle.region.api.aws エンドポイントは、OpenAIResponsions API、OpenAIChat Completions API、および Anthropic Messages API を提供します。このエンドポイントへの推論トラフィックは、bedrock-runtimeエンドポイントとは別のクォータのセットによって管理されます。

Service Quotas コンソールでクォータを表示するには、Amazon Bedrock bedrock-mantle をサービスとして選択し、Bedrock Mantle を検索します。これらのクォータの引き上げをリクエストするには、「」を参照してくださいクォータ引き上げのリクエスト

クォータタイプ

bedrock-mantle エンドポイントの推論は、モデルごとの 2 つのクォータによって管理されます。

モデルあたりの bedrock-mantle クォータ
クォータ スコープ 説明
${model} の Bedrock Mantle 入力トークン/分 モデルごと、リージョンごと アカウントがbedrock-mantleエンドポイントのモデルに送信できる 1 分あたりの入力トークンの最大数。そのモデルのエンドポイントによって提供されるすべての APIs 間で共有されます。
${model} の Bedrock Mantle 出力トークン/分 モデルごと、リージョンごと モデルがbedrock-mantleエンドポイントのアカウントに対して生成できる 1 分あたりの出力トークンの最大数。そのモデルのエンドポイントによって提供されるすべての APIs 間で共有されます。
注記

プロンプトキャッシュを介して読み取られたキャッシュされた入力トークンは、1 input-tokens-per-minuteクォータにはカウントされません。

注記

bedrock-mantle エンドポイントは、1 requests-per-minute (RPM) クォータを適用しません。スロットリングは、このセクションで説明する入出力トークンクォータによってのみ管理されます。

クォータに対するリクエストの評価方法

bedrock-mantle エンドポイントに推論リクエストを送信すると、 は次の順序でクォータに対してそのリクエスト AWS を評価します。

  1. 1 分あたりの入力トークン – リクエスト内の入力トークンの数と の値 max_tokens ( が設定されていない場合はモデル固有の最大値) max_tokensが、リクエストされたモデルの 1 input-tokens-per-minuteクォータと照合されます。リクエストを承認するとクォータを超えると、リクエストは HTTP 429 レスポンスでスロットリングされます。

  2. 1 分あたりの出力トークン – モデルが出力をストリーミングまたは生成すると、出力トークンはそのモデルの 1 output-tokens-per-minuteクォータに対してカウントされます。生成中にクォータに達すると、生成は停止し、カットオフを示す終了理由とともにレスポンスが返されます。

レスポンスが完了すると、最初の入力トークン予約の未使用部分 ( max_tokensと実際の出力の差) がクォータに補充されます。

エンドポイントは、Service Quotas で公開されていない追加の内部レート制限を適用する場合があります。一時的なスロットリングを処理するには、エクスポネンシャルバックオフで再試行ロジックを使用します。

bedrock-runtime エンドポイントの TPM クォータは、入力トークンと出力トークンを 1 つのモデルごとのクォータに対してカウントし、bedrock-mantleエンドポイントは 1 input-tokens-per-minuteと 1 output-tokens-per-minuteのクォータを別々に適用します。両方のエンドポイントでワークロードを実行する場合は、各エンドポイントの容量を個別に計画します。ランタイムエンドポイントのクォータの詳細については、「」を参照してくださいbedrock-runtime エンドポイントのクォータ

デフォルトのクォータ値

次の表に、bedrock-mantleエンドポイントのモデルのデフォルトクォータを示します。新しい AWS アカウント ではクォータが削減され、クォータはリージョンによって異なる場合があります。

モデル別のデフォルトの bedrock-mantle クォータ
モデル デフォルトの入力 TPM デフォルトの出力 TPM
Anthropic Claude Opus 4.7 20,000,000 4,000,000

追加のモデルは、エンドポイントで起動するときにこの表に一覧表示されます。

TPM クォータが公開されていないモデル

bedrock-mantle エンドポイントは、上記の表にリストされているモデルに対してのみ、公開された TPM クォータを適用します。このエンドポイントで提供される他のモデルには、現在 Service Quotas で公開されているアカウントごとの TPM クォータはありません。そのスループットは、内部サービス容量によって管理されます。 は、使用量のスケールに応じて追加のモデルにアカウントごとのクォータを導入 AWS する可能性があります。一時的なスロットリングを処理するには、エクスポネンシャルバックオフで再試行ロジックを使用します。特定のモデルの公開クォータが必要な場合は、 AWS サポートにお問い合わせください。

サポート対象のリージョン

bedrock-mantle クォータは、bedrock-mantleエンドポイントが利用可能な同じ AWS リージョンの Service Quotas に表示されます。リージョンとエンドポイント URLs「」を参照してくださいサポートされているリージョンとエンドポイント

クォータ引き上げのリクエスト

bedrock-mantle クォータは Service Quotas に表示されますが、クォータ引き上げリクエストは現在 Service Quotas コンソールでは処理されません。引き上げをリクエストするには、AWS サポート制限引き上げフォームからリクエストを送信し、サービスとして Amazon Bedrock を選択します。リクエストで、以下を指定します。

  • エンドポイント (bedrock-mantle)。

  • リージョン。

  • モデル

  • クォータ名 (入力 TPM または出力 TPM) とリクエストする値。

1 つのサポートケースで、同じモデルに対して input-tokens-per-minute数と output-tokens-per-minute数の増加をリクエストできます。承認は、既存の使用量の増加を正当化するかどうかによって異なるため、CloudWatch または Service Quotas コンソールからの最近の使用状況情報をリクエストに含めます。

bedrock-runtime クォータとの違い

bedrock-mantle クォータはbedrock-runtimeクォータから独立しています。同じ基盤となるモデルを呼び出す場合でも、個別のクォータ割り当てをbedrock-mantle.region.api.aws消費する bedrock-runtime.region.amazonaws.comおよび へのトラフィック。

カスタム推論プロファイルクォータ、バッチ推論クォータ、プロビジョンドスループット割り当てはbedrock-runtime、エンドポイントにのみ適用され、bedrock-mantleエンドポイントでは公開されません。