本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。
bedrock-mantle 端點的配額
bedrock-mantle. 端點提供OpenAI回應 API、OpenAI聊天完成 API 和 Anthropic Messages API。至此端點的推論流量由region.api.awsbedrock-runtime端點的一組個別配額管理。
您可以透過選取 bedrock-mantle Amazon Bedrock 做為服務並搜尋 Bedrock Mantle,在 Service Quotas 主控台中檢視配額。若要請求提高任何這些配額,請參閱 請求提高配額。
配額類型
bedrock-mantle 端點上的推論由每個模型的兩個配額管理:
| 配額 | Scope (範圍) | 說明 |
|---|---|---|
${model} 的每分鐘 Bedrock Mantle 輸入字符 |
每個模型、每個區域 | 您的帳戶每分鐘可提交至bedrock-mantle端點上模型的輸入字符數目上限。在端點為該模型提供的所有 APIs之間共用。 |
${model} 每分鐘 Bedrock Mantle 輸出字符 |
每個模型、每個區域 | 模型可在bedrock-mantle端點上為您的帳戶產生的每分鐘輸出字符數目上限。在端點為該模型提供的所有 APIs之間共用。 |
注意
透過提示快取讀取的快取輸入字符不會計入input-tokens-per-minute配額。
注意
bedrock-mantle 端點不會強制執行requests-per-minute(RPM) 配額。限流僅由本節所述的輸入和輸出字符配額管理。
如何針對配額評估請求
當您向bedrock-mantle端點提交推論請求時, 會依下列順序針對您的配額 AWS 進行評估:
-
每分鐘輸入字符 – 請求中的輸入字符數量,加上 的值
max_tokens(或未max_tokens設定模型特定的最大值),會根據所請求模型的input-tokens-per-minute配額進行檢查。如果允許請求超過配額,則會使用 HTTP 429 回應調節請求。 -
每分鐘輸出權杖 – 當模型串流或產生輸出時,輸出權杖會計入該模型的output-tokens-per-minute配額。如果在產生期間達到配額,則產生會停止,並傳回回應,並帶有表示截止的結束原因。
回應完成後,初始輸入字符保留的任何未使用部分 ( max_tokens和實際輸出之間的差異) 都會補充到您的配額。
端點可能會套用 Service Quotas 中未公開的其他內部速率限制。使用具有指數退避的重試邏輯來處理暫時性限流。
bedrock-runtime 端點的 TPM 配額根據單一每模型配額一起計算輸入和輸出權杖,而bedrock-mantle端點則會套用個別input-tokens-per-minute和output-tokens-per-minute配額。如果您在兩個端點上執行工作負載,請獨立規劃每個端點的容量。如需執行時間端點配額的詳細資訊,請參閱 bedrock-runtime 端點的配額。
預設配額值
下表列出bedrock-mantle端點上模型的預設配額。新 AWS 帳戶 可能會收到減少的配額,而配額可能因區域而異。
| 模型 | 預設輸入 TPM | 預設輸出 TPM |
|---|---|---|
| Anthropic Claude Opus 4.7 | 20,000,000 | 4,000,000 |
其他模型會在端點上啟動時列在此資料表中。
沒有已發佈 TPM 配額的模型
bedrock-mantle 端點只會針對上表中列出的模型強制執行已發佈的 TPM 配額。此端點上提供的其他模型目前沒有 Service Quotas 中公開的每個帳戶 TPM 配額 – 其輸送量受內部服務容量管理。隨著用量擴展, AWS 可能會引入其他模型的每個帳戶配額。使用具有指數退避的重試邏輯來處理暫時性限流。如果您需要特定模型的已發佈配額,請聯絡 AWS Support。
支援的區域
bedrock-mantle 配額會顯示在提供bedrock-mantle端點的相同 AWS 區域中的 Service Quotas 中。如需區域和端點 URLs的完整清單,請參閱 支援的區域和端點。
請求提高配額
bedrock-mantle 配額會顯示在 Service Quotas 中,但配額增加請求目前不會透過 Service Quotas 主控台處理。若要請求提高,請透過AWS 支援提高限制表單
-
端點 (
bedrock-mantle)。 -
區域。
-
模型。
-
配額名稱 (輸入 TPM 或輸出 TPM) 以及您請求的值。
在單一支援案例中,您可以針對相同的模型請求增加至input-tokens-per-minute和output-tokens-per-minute訊號。核准取決於您現有的用量是否合理增加,因此請在您的請求中包含來自 CloudWatch 或 Service Quotas 主控台的最新用量資訊。
與底ock-runtime 配額的差異
bedrock-mantle 配額與bedrock-runtime配額無關。即使呼叫相同的基礎模型, 流量bedrock-runtime.和流量也會region.amazonaws.com.rproxy.govskope.cabedrock-mantle.使用不同的配額分配。region.api.aws
自訂推論設定檔配額、批次推論配額和佈建輸送量配置僅適用於bedrock-runtime端點,且不會在bedrock-mantle端點上公開。