Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Gemma 4 E2B
Google — Gemma 4 E2B
Modelldetails
Gemma 4 E2B ist Googles kompaktes Modell mit insgesamt 5,1 Milliarden Parametern und 2,3 Milliarden effektiven Parametern unter Verwendung von Per-Layer Embeddings (PLE). Es wurde für Workloads mit niedriger Latenz entwickelt und bietet integrierte Argumentation, native Funktionsaufrufe und multimodale Eingabe in Text und Bild. Es unterstützt ein 128.000 Token-Kontextfenster. Weitere Informationen zur Modellentwicklung und Leistung finden Sie auf der Karte. model/service
Datum der Markteinführung des Modells: 10. Juni 2025
EOL-Datum des Modells: N/A
Endbenutzer-Lizenzverträge und Nutzungsbedingungen: Ansehen https://ai.google.dev/gemma/apache_2
Lebenszyklus des Modells: Aktiv
Kontextfenster: 128.000 Token
| Eingabemodalitäten | Modalitäten der Ausgabe | Unterstützte APIs | Unterstützte Endpunkte |
|---|---|---|---|
Responses | bedrock-runtime | ||
Chat Completions | bedrock-mantle | ||
Invoke | |||
Converse | |||
Messages |
Anmerkung
Gemma 4-Modelle sind nur auf dem bedrock-mantle Endpunkt verfügbar.
Anbedrock-mantle, dieses Modell wird unter serviert/openai/v1/responses, nicht in der Standardeinstellung/v1/responses.
Fähigkeiten und Funktionen
Funktionen von Bedrock
Funktionen, die mithilfe bedrock-mantle von Endpoint unterstützt werden
| Unterstützt | Nicht unterstützt |
|---|---|
|
— |
Preisgestaltung
Preisinformationen finden Sie auf der Preisseite von
Programmatischer Zugriff
Verwenden Sie die folgenden Modell-IDs und Endpunkt-URLs, um programmgesteuert auf dieses Modell zuzugreifen. Weitere Informationen zu den verfügbaren APIs und Endpunkten finden Sie unter Unterstützte APIs und Unterstützte Endpunkte.
| Endpunkt | Modell-ID | In-Region URL des Endpunkts | Geoinferenz-ID | Globale Inferenz-ID |
|---|---|---|---|---|
bedrock-mantle |
google.gemma-4-e2b |
https://bedrock-mantle.{region}.api.aws/openai/v1 |
Nicht unterstützt | Nicht unterstützt |
Wenn die Region beispielsweise us-east-1 (Nord-Virginia) ist, lautet die Bedrock-Mantle-Endpunkt-URL "“. https://bedrock-mantle.us-east-1.api.aws/openai/v1
Servicestufen
Amazon Bedrock bietet mehrere Servicestufen, um Ihren Workload-Anforderungen gerecht zu werden. Standard bietet Pay-per-Token-Zugriff ohne Verpflichtung (setzen Sie das Feld ein "service_tier": "default" oder lassen Sie es weg). Priority bietet die schnellsten Reaktionszeiten gegen einen Preisaufschlag (Set). "service_tier": "priority" Flex bietet kostengünstigen Zugriff auf flexible, nicht zeitkritische Workloads (Set). "service_tier": "flex" Reserved bietet einen dedizierten Durchsatz mit einer bestimmten Laufzeit für vorhersehbare Workloads. Dieser Wert wird auf Kontoebene und nicht pro Anfrage festgelegt (wenden Sie sich zur Aktivierung an Ihr AWS-Kontenteam). Weitere Informationen finden Sie unter Servicestufen.
| Standard | Priorität | Flex | Reserviert |
|---|---|---|---|
Regionale Verfügbarkeit
Regionale Verfügbarkeit auf einen Blick
Amazon Bedrock bietet drei Ableitungsoptionen: In-Region Es werden Anfragen innerhalb einer einzigen Region zur strikten Einhaltung der Vorschriften gespeichert, Cross-Region Geo-Routen zwischen Regionen innerhalb einer Region (z. B. USA, EU und APAC) unter Berücksichtigung der Datenresidenz, und globale Cross-Region Routen überall auf der Welt, wenn keine Wohnsitzbeschränkungen bestehen. Weitere Informationen finden Sie auf der SeiteRegionale Verfügbarkeit nach Modellen.
| Region | In-Region | Geo | Global |
|---|---|---|---|
us-east-1(Nord-Virginia) | |||
us-east-2(Ohio) | |||
us-west-2(Oregon) | |||
eu-central-1(Frankfurt) |
Kontingente und Einschränkungen
Ihr AWS Konto verfügt über Standardkontingente, um die Leistung des Dienstes aufrechtzuerhalten und eine angemessene Nutzung von Amazon Bedrock sicherzustellen. Die einem Konto zugewiesenen Standardkontingente können je nach regionalen Faktoren, Zahlungsverlauf, betrügerischer Nutzung und and/or Genehmigung einer Anfrage zur Kontingenterhöhung aktualisiert werden. Weitere Informationen finden Sie in der Kontingente für Amazon Bedrock Dokumentation und in den Grenzwerten für das Modell.
Bei Nutzung des On-Demand-Durchsatzes auf dem bedrock-mantle Endpunkt skaliert der verfügbare Durchsatz im Laufe der Zeit. In Zeiten hoher Nachfrage ist nicht garantiert, dass alle Anfragen innerhalb Ihres Kontingents erfolgreich sind. Daher ist es wichtig, die Anforderungen schrittweise zu erhöhen. Bei diesem Modell werden die Standardlimits nicht direkt in den Servicekontingenten angezeigt. Wir empfehlen daher, sich an der Rampe zu orientieren.
Beispiel-Code
Schritt 1 — AWS Konto: Wenn Sie bereits ein AWS Konto haben, überspringen Sie diesen Schritt. Wenn Sie neu bei uns sind AWS, registrieren Sie sich für ein AWS-Konto
Schritt 2 — API-Schlüssel: Gehen Sie zur Amazon Bedrock-Konsole
Schritt 3 — Holen Sie sich das SDK: Um dieses Handbuch für die ersten Schritte verwenden zu können, muss Python bereits installiert sein. Installieren Sie dann die entsprechende Software je nach den von Ihnen verwendeten APIs.
pip install openai
Schritt 4 — Umgebungsvariablen festlegen: Konfigurieren Sie Ihre Umgebung so, dass der API-Schlüssel für die Authentifizierung verwendet wird.
OPENAI_API_KEY="<provide your Bedrock API key>" OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/openai/v1"
Schritt 5 — Führen Sie Ihre erste Inferenzanforderung aus: Speichern Sie die Datei unter bedrock-first-request.py
Überlegungen und Einschränkungen bei der Verwendung
Argumentationsmodus — Der Begründungsaufwand wird sowohl in den APIs „Chat-Abschluss“ als auch in „Antworten“ berücksichtigt, und das Modell führt in beiden Fällen die erweiterte Argumentation durch. Der Inhalt der Argumentation wird jedoch nur von der Responses API zurückgegeben. Die Chat Completions API gibt die Begründungstoken nicht zurück, da die OpenAI Chat Completions-Spezifikation deren Rückgabe nicht unterstützt.
Argumentationsaufwand — Für Gemma 4 E2B empfehlen wir die Einstellung
reasoning_effortauf, wodurch der Denkmodus aktiviert wird.highDiese Variante neigt dazu, standardmäßig ausgiebig zu argumentieren, und ein hoher Argumentationsaufwand sorgt dafür, dass diese Argumentation im dafür vorgesehenen Argumentationskanal bleibt, was die Ausgabequalität verbessert und verhindert, dass der Argumentationstext in der endgültigen Antwort erscheint.Parallele Werkzeuganrufe — Das Anfordern von mehr als einem Werkzeuganruf in einem Zug wird derzeit nicht unterstützt. Fordere Werkzeuganrufe nacheinander an.
Größe der Anforderungsnutzlast — Die gesamte Nutzlast des Anforderungstexts für Gemma 4 E2B, einschließlich Bilder und Videos, unterstützt eine maximale Größe von 3,5 MB.