Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Gemma 4 E2B
Google — Gemma 4 E2B
Dettagli del modello
Gemma 4 E2B è il modello compatto di Google con 5,1 miliardi di parametri totali e 2,3 miliardi di parametri effettivi che utilizza Per-Layer Embeddings (PLE), progettato per carichi di lavoro a bassa latenza con ragionamento integrato, chiamata di funzioni native e input multimodale su testo e immagine, che supporta una finestra contestuale di token da 128K. Per ulteriori informazioni sullo sviluppo e sulle prestazioni del modello, consulta la scheda. model/service
Data di lancio del modello: 10 giugno 2025
Data EOL del modello: N/A
Contratti di licenza con l'utente finale e condizioni d'uso: Visualizza https://ai.google.dev/gemma/apache_2
Ciclo di vita del modello: attivo
Finestra contestuale: 128K token
| Modalità di input | Modalità di output | API supportate | Endpoint supportati |
|---|---|---|---|
Responses | bedrock-runtime | ||
Chat Completions | bedrock-mantle | ||
Invoke | |||
Converse | |||
Messages |
Nota
I modelli Gemma 4 sono disponibili solo sull'bedrock-mantleendpoint.
Attivatobedrock-mantle, questo modello viene utilizzato in modalità predefinita e non in /openai/v1/responses quella predefinita. /v1/responses
Funzionalità e caratteristiche
Caratteristiche di Bedrock
Funzionalità supportate tramite endpoint bedrock-mantle
| Supportato | Non supportato |
|---|---|
|
— |
Prezzi
Per informazioni sui prezzi, consulta la pagina dei prezzi di
Accesso programmatico
Utilizzate i seguenti ID del modello e URL degli endpoint per accedere a questo modello a livello di codice. Per ulteriori informazioni sulle API e sugli endpoint disponibili, consulta API supportate ed Endpoint supportati. bedrock/latest/userguide/endpoints.html
| Endpoint | ID del modello | In-Region URL dell'endpoint | ID di geo-inferenza | ID di inferenza globale |
|---|---|---|---|---|
bedrock-mantle |
google.gemma-4-e2b |
https://bedrock-mantle.{region}.api.aws/openai/v1 |
Non supportata | Non supportata |
Ad esempio, se la regione è us-east-1 (Virginia settentrionale), l'URL dell'endpoint bedrock-mantle sarà "». https://bedrock-mantle.us-east-1.api.aws/openai/v1
Livelli di servizio
Amazon Bedrock offre diversi livelli di servizio per soddisfare i requisiti del carico di lavoro. Standard fornisce l'accesso pay-per-token senza impegno (imposta o ometti il campo). "service_tier": "default" Priority offre i tempi di risposta più rapidi a un prezzo superiore (impostato). "service_tier": "priority" Flex offre un accesso a basso costo per carichi di lavoro flessibili e non sensibili al fattore tempo (set). "service_tier": "flex" Reserved offre un throughput dedicato con un impegno a termine per carichi di lavoro prevedibili; è impostato a livello di account anziché su richiesta (contatta il team del tuo account AWS per abilitare). Per ulteriori informazioni, consulta i livelli di servizio.
| Standard | Priorità | Flex | Riservato |
|---|---|---|---|
Disponibilità regionale
La disponibilità regionale a colpo d'occhio
Amazon Bedrock offre tre opzioni di inferenza: In-Region mantiene le richieste all'interno di una singola regione per garantire una conformità rigorosa, le Cross-Region rotte geografiche tra le regioni all'interno di un'area geografica (come Stati Uniti, UE e APAC) rispettando la residenza dei dati e le Cross-Region rotte globali in qualsiasi parte del mondo quando non ci sono vincoli di residenza. Per maggiori dettagli, consulta la pagina. Disponibilità regionale per modelli
| Region | In-Region | Geo | Globale |
|---|---|---|---|
us-east-1(Virginia del Nord) | |||
us-east-2(Ohio) | |||
us-west-2(Oregon) | |||
eu-central-1(Francoforte) |
Quote e limiti
Il tuo AWS account ha delle quote predefinite per mantenere le prestazioni del servizio e garantire un uso appropriato di Amazon Bedrock. Le quote predefinite assegnate a un account potrebbero essere aggiornate in base a fattori regionali, alla cronologia dei pagamenti, all'uso fraudolento, all' and/or approvazione di una richiesta di aumento delle quote. bedrock/latest/userguide/quotas-increase.html Per ulteriori informazioni, consulta Quote per Amazon Bedrock la documentazione e consulta i limiti del modello.
Quando si consuma il throughput su richiesta sull'bedrock-mantleendpoint, il throughput disponibile aumenta nel tempo. Non è garantito il successo di tutte le richieste entro la quota prevista durante i periodi di forte domanda, quindi è importante aumentarle gradualmente. Per questo modello, i limiti predefiniti non vengono visualizzati direttamente tramite Service Quotas, quindi consigliamo di seguire la rampa come guida.
Codice di esempio
Passaggio 1 - AWS Account: se hai già un AWS account, salta questo passaggio. Se non conosci AWS, crea un account https://portal.aws.amazon.com/billing/signup
Passaggio 2 - Chiave API: accedi alla console Amazon Bedrock
Passaggio 3 - Scarica l'SDK: per utilizzare questa guida introduttiva, devi avere Python già installato. Quindi installa il software pertinente in base alle API che stai utilizzando.
pip install openai
Passaggio 4 - Impostazione delle variabili di ambiente: configura il tuo ambiente per utilizzare la chiave API per l'autenticazione.
OPENAI_API_KEY="<provide your Bedrock API key>" OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/openai/v1"
Fase 5 - Esegui la tua prima richiesta di inferenza: salva il file con nome bedrock-first-request.py
Considerazioni e limitazioni sull'utilizzo
Modalità di ragionamento: lo sforzo di ragionamento viene rispettato sia nelle API Chat Completions che Responses e il modello esegue il ragionamento esteso in entrambi i casi. Tuttavia, il contenuto del ragionamento viene restituito solo dall'API Responses. L'API Chat Completions non restituisce i token di ragionamento, poiché la specifica OpenAI Chat Completions non supporta la loro restituzione.
Sforzo di ragionamento: per Gemma 4 E2B, consigliamo di impostare su, che abilita la modalità di pensiero.
reasoning_efforthighPer impostazione predefinita, questa variante tende a ragionare estensivamente e un elevato sforzo di ragionamento mantiene tale ragionamento nel canale di ragionamento dedicato, il che migliora la qualità dell'output e impedisce la visualizzazione del testo di ragionamento nella risposta finale.Chiamate parallele agli strumenti: la richiesta di più di una chiamata allo strumento in un solo turno non è attualmente supportata. Richiedi le chiamate allo strumento una alla volta.
Dimensione del payload della richiesta: il payload totale del corpo della richiesta per Gemma 4 E2B, incluse immagini e video, supporta una dimensione massima di 3,5 MB.