View a markdown version of this page

Kontingente für den Endpunkt „Bedrock-Mantle“ - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Kontingente für den Endpunkt „Bedrock-Mantle“

Der bedrock-mantle.region.api.aws Endpunkt dient der OpenAI Responses API, der OpenAI Chat Completions API und der Anthropic Messages API. Der Inferenzdatenverkehr zu diesem Endpunkt wird durch andere Kontingente als der Endpunkt geregelt. bedrock-runtime

Sie können bedrock-mantle Kontingente in der Service Quotas Quotas-Konsole anzeigen, indem Sie Amazon Bedrock als Service auswählen und nach Bedrock Mantle suchen. Informationen zur Beantragung einer Erhöhung dieser Kontingente finden Sie unter. Beantragen einer Kontingenterhöhung

Arten von Kontingenten

Die Inferenz auf dem bedrock-mantle Endpunkt wird durch zwei Kontingente pro Modell bestimmt:

Grundlegende Quoten pro Modell
Kontingent Scope Description
Bedrock Mantle-Eingabetoken pro Minute für ${model} Pro Modell, pro Region Die maximale Anzahl von Eingabe-Token pro Minute, die Ihr Konto an das Modell auf dem bedrock-mantle Endpunkt senden kann. Wird von allen APIs gemeinsam genutzt, die vom Endpunkt für dieses Modell bereitgestellt werden.
Bedrock Mantle gibt Tokens pro Minute aus für ${model} Pro Modell, pro Region Die maximale Anzahl von Ausgabetokens pro Minute, die das Modell für Ihr Konto auf dem bedrock-mantle Endpunkt generieren kann. Wird von allen APIs gemeinsam genutzt, die vom Endpunkt für dieses Modell bereitgestellt werden.
Anmerkung

Im Cache zwischengespeicherte Eingabetoken, die über das Zwischenspeichern von Eingabeaufforderungen gelesen werden, werden nicht auf das Kontingent für Eingabe-Tokens pro Minute angerechnet.

Anmerkung

Der bedrock-mantle Endpunkt erzwingt keine Quoten für Anfragen pro Minute (RPM). Die Drosselung wird ausschließlich durch die in diesem Abschnitt beschriebenen Quoten für Eingabe- und Ausgabetokens geregelt.

Wie Anfragen anhand von Kontingenten bewertet werden

Wenn Sie eine Inferenzanforderung an den bedrock-mantle Endpunkt senden, wird sie anhand Ihrer Kontingente in der folgenden Reihenfolge AWS bewertet:

  1. Eingabe-Tokens pro Minute — Die Anzahl der Eingabe-Token in der Anfrage zuzüglich des Werts von max_tokens (oder des modellspezifischen Maximums, falls nicht festgelegt), max_tokens wird mit der Quote für Eingabe-Tokens pro Minute für das angeforderte Modell verglichen. Wenn das Zulassen der Anfrage das Kontingent überschreiten würde, wird die Anfrage mit einer HTTP 429-Antwort gedrosselt.

  2. Ausgabetokens pro Minute — Wenn das Modell streamt oder Ausgaben generiert, werden die Ausgabetokens auf das Kontingent für Ausgabetokens pro Minute für dieses Modell angerechnet. Wenn das Kontingent während der Generierung erreicht wird, wird die Generierung gestoppt und die Antwort wird mit einem Endgrund zurückgegeben, der den Grenzwert angibt.

Nach Abschluss der Antwort wird jeder ungenutzte Teil der ursprünglichen Reservierung für das Eingabe-Tokens (die Differenz zwischen max_tokens und der tatsächlichen Ausgabe) auf Ihr Kontingent aufgefüllt.

Der Endpunkt kann zusätzliche interne Ratenbegrenzungen anwenden, die in den Service Quotas nicht angegeben sind. Verwenden Sie die Wiederholungslogik mit exponentiellem Backoff, um vorübergehende Drosselung zu behandeln.

Die TPM-Kontingente des bedrock-runtime Endpunkts zählen Eingabe- und Ausgabetokens zusammen gegen eine einzige Quote pro Modell, während der Endpunkt separate Kontingente für Eingabetoken pro Minute und Ausgabetokens pro Minute anwendet. bedrock-mantle Wenn Sie Workloads auf beiden Endpunkten ausführen, planen Sie die Kapazität für jeden Endpunkt unabhängig. Einzelheiten zu den Kontingenten des Runtime-Endpunkts finden Sie unter. Kontingente für den Bedrock-Runtime-Endpunkt

Standardkontingentwerte

In der folgenden Tabelle sind die Standardkontingente für Modelle auf dem bedrock-mantle Endpunkt aufgeführt. Neue Produkte erhalten AWS-Konten möglicherweise reduzierte Kontingente, und Kontingente können je nach Region variieren.

Standardmäßige Kontingente je nach Modell
Modell Standard-Eingabe-TPM Standard-Ausgabe-TPM
AnthropicClaude Opus 4.7 20,000,000 4.000.000

Weitere Modelle werden in dieser Tabelle aufgeführt, sobald sie auf dem Endpunkt gestartet werden.

Modelle ohne veröffentlichte TPM-Kontingente

Der bedrock-mantle Endpunkt setzt veröffentlichte TPM-Kontingente nur für die in der obigen Tabelle aufgeführten Modelle durch. Bei anderen Modellen, die auf diesem Endpunkt bedient werden, sind derzeit keine TPM-Kontingente pro Konto in Service Quotas aufgeführt — ihr Durchsatz wird von der internen Servicekapazität bestimmt. AWS könnte je nach Nutzungsskala Kontingente pro Konto für zusätzliche Modelle einführen. Verwenden Sie die Wiederholungslogik mit exponentiellem Backoff, um vorübergehende Drosselung zu handhaben. Wenn Sie ein veröffentlichtes Kontingent für ein bestimmtes Modell benötigen, wenden Sie sich an den AWS Support.

Unterstützte Regionen

bedrock-mantleKontingente sind unter Service Quotas in denselben AWS Regionen sichtbar, in denen der bedrock-mantle Endpunkt verfügbar ist. Die vollständige Liste der Regionen und Endpunkt-URLs finden Sie unterUnterstützte Regionen und Endpunkte.

Beantragen einer Kontingenterhöhung

Die bedrock-mantle Kontingente sind in Service Quotas sichtbar, aber Anfragen zur Erhöhung des Kontingents werden derzeit nicht über die Service Quotas Quota-Konsole bearbeitet. Um eine Erhöhung zu beantragen, reichen Sie eine Anfrage über das Formular zur Erhöhung des AWS Supportlimits ein und wählen Sie Amazon Bedrock als Service aus. Geben Sie in Ihrer Anfrage Folgendes an:

  • Der Endpunkt (bedrock-mantle).

  • Die -Region.

  • Das Modell.

  • Der Kontingentname (Eingabe-TPM oder Ausgabe-TPM) und der Wert, den Sie anfordern.

In einem einzigen Support-Fall können Sie für dasselbe Modell eine Erhöhung der Eingabetoken pro Minute und der Ausgabetokens pro Minute beantragen. Die Genehmigung hängt davon ab, ob Ihre aktuelle Nutzung die Erhöhung rechtfertigt. Fügen Sie Ihrer Anfrage daher aktuelle Nutzungsinformationen von CloudWatch oder der Service Quotas Quotas-Konsole bei.

Unterschiede zu Bedrock-Runtime-Kontingenten

Die bedrock-mantle Kontingente sind unabhängig von den bedrock-runtime Kontingenten. Datenverkehr zu bedrock-runtime.region.amazonaws.com und Datenverkehr, der unterschiedliche Kontingentzuweisungen bedrock-mantle.region.api.aws beansprucht, auch wenn dasselbe zugrunde liegende Modell aufgerufen wird.

Benutzerdefinierte Kontingente für Inferenzprofile, Kontingente für Batch-Inferenzen und Zuweisungen für bereitgestellten Durchsatz gelten nur für den bedrock-runtime Endpunkt und sind auf dem Endpunkt nicht verfügbar. bedrock-mantle