Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Gemma 4 E2B
Google — Gemma 4 E2B
Détails du modèle
Gemma 4 E2B est le modèle compact de Google avec 5,1 milliards de paramètres au total et 2,3 milliards de paramètres effectifs utilisant Per-Layer Embeddings (PLE), conçu pour les charges de travail à faible latence avec raisonnement intégré, appel de fonction natif et saisie multimodale entre texte et image, prenant en charge une fenêtre contextuelle de 128 000 jetons. Pour plus d'informations sur le développement et les performances des modèles, consultez la model/service fiche
Date de lancement du modèle : 10 juin 2025
Date de fin de vie du modèle : N/A
Contrats de licence utilisateur final et conditions d'utilisation : Afficher
Cycle de vie du modèle : actif
Fenêtre contextuelle : 128 000 jetons
| Modalités de saisie | Modalités de sortie | API prises en charge | Points de terminaison pris en charge |
|---|---|---|---|
Responses | bedrock-runtime | ||
Chat Completions | bedrock-mantle | ||
Invoke | |||
Converse | |||
Messages |
Note
Les modèles Gemma 4 ne sont disponibles que sur le bedrock-mantle terminal.
Activébedrock-mantle, ce modèle est servi à /openai/v1/responses temps et non par défaut/v1/responses.
Capacités et fonctionnalités
Caractéristiques de Bedrock
Fonctionnalités prises en charge via bedrock-mantle Endpoint
| Supporté | Non pris en charge |
|---|---|
|
— |
Tarification
Pour plus d'informations sur les tarifs, consultez la page de tarification d'
Accès programmatique
Utilisez les ID de modèle et les URL de point de terminaison suivants pour accéder à ce modèle par programmation. Pour plus d'informations sur les API et les points de terminaison disponibles, consultez les sections API prises en charge et Points de terminaison pris en charge.
| Point de terminaison | ID du modèle | In-Region URL du terminal | ID d'inférence géographique | ID d'inférence global |
|---|---|---|---|---|
bedrock-mantle |
google.gemma-4-e2b |
https://bedrock-mantle.{region}.api.aws/openai/v1 |
Non pris en charge | Non pris en charge |
Par exemple, si la région est us-east-1 (Virginie du Nord), l'URL du point de terminaison du manteau rocheux sera « ». https://bedrock-mantle.us-east-1.api.aws/openai/v1
Niveaux de service
Amazon Bedrock propose plusieurs niveaux de service pour répondre à vos exigences en matière de charge de travail. Standard fournit un accès au paiement par jeton sans engagement (définissez "service_tier": "default" ou omettez le champ). Priority offre les temps de réponse les plus rapides pour un prix plus élevé (fixe"service_tier": "priority"). Flex fournit un accès à moindre coût pour des charges de travail flexibles et non sensibles au facteur temps (set). "service_tier": "flex" Reserved fournit un débit dédié assorti d'un engagement à terme pour des charges de travail prévisibles ; il est défini au niveau du compte plutôt que par demande (contactez l'équipe responsable de votre compte AWS pour l'activer). Pour plus d'informations, consultez la section Niveaux de service.
| Standard | Priorité | Flexible | Réservé |
|---|---|---|---|
Disponibilité par région
La disponibilité régionale en un coup d'œil
Amazon Bedrock propose trois options d'inférence : In-Region conserve les demandes dans une seule région pour des raisons de stricte conformité, géolocalise Cross-Region les itinéraires entre les régions d'une même zone géographique (comme les États-Unis, l'UE et l'APAC) tout en respectant la résidence des données, et les Cross-Region itinéraires mondiaux partout dans le monde lorsqu'il n'y a aucune contrainte de résidence. Consultez la Disponibilité régionale par modèle page pour plus de détails.
| Région | In-Region | Géo | Solution internationale |
|---|---|---|---|
us-east-1(Virginie du Nord) | |||
us-east-2(Ohio) | |||
us-west-2(Oregon) | |||
eu-central-1(Francfort) |
Quotas et limites
Votre AWS compte possède des quotas par défaut afin de maintenir les performances du service et de garantir une utilisation appropriée d'Amazon Bedrock. Les quotas par défaut attribués à un compte peuvent être mis à jour en fonction de facteurs régionaux, de l'historique des paiements, d'une utilisation frauduleuse ou de and/or l'approbation d'une demande d'augmentation de quota. Pour plus d'informations, consultez Quotas pour Amazon Bedrock la documentation et consultez les limites du modèle.
Lorsque vous consommez du débit à la demande sur le bedrock-mantle terminal, le débit disponible évolue au fil du temps. Le succès de toutes les demandes ne dépassant pas votre quota n'est pas garanti pendant les périodes de forte demande. Il est donc important de procéder à une augmentation graduelle. Pour ce modèle, les limites par défaut ne sont pas définies directement via les quotas de service. Nous vous recommandons donc de suivre la rampe comme guide.
Exemple de code
Étape 1 - AWS Compte : Si vous avez déjà un AWS compte, ignorez cette étape. Si vous êtes nouveau sur AWS AWS, créez un compte AWS
Étape 2 - Clé API : Accédez à la console Amazon Bedrock
Étape 3 - Téléchargez le SDK : pour utiliser ce guide de démarrage, Python doit déjà être installé. Installez ensuite le logiciel approprié en fonction des API que vous utilisez.
pip install openai
Étape 4 - Définissez les variables d'environnement : configurez votre environnement pour utiliser la clé API pour l'authentification.
OPENAI_API_KEY="<provide your Bedrock API key>" OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/openai/v1"
Étape 5 - Exécutez votre première demande d'inférence : enregistrez le fichier sous bedrock-first-request.py
Considérations et limites relatives à l'utilisation
Mode de raisonnement : l'effort de raisonnement est respecté à la fois sur les API Chat Completions et Responses, et le modèle exécute le raisonnement étendu dans les deux cas. Cependant, le contenu du raisonnement est renvoyé uniquement par l'API Responses. L'API Chat Completions ne renvoie pas les jetons de raisonnement, car la spécification OpenAI Chat Completions ne permet pas de les renvoyer.
Effort de raisonnement — Pour Gemma 4 E2B, nous vous recommandons de
reasoning_effortrégler surhigh, ce qui active le mode réflexion. Cette variante a tendance à raisonner longuement par défaut, et un effort de raisonnement élevé permet de maintenir ce raisonnement dans le canal de raisonnement dédié, ce qui améliore la qualité de la sortie et empêche le texte de raisonnement d'apparaître dans la réponse finale.Appels d'outils parallèles : la demande de plusieurs appels d'outils en un seul tour n'est actuellement pas prise en charge. L'outil de demande appelle un par un.
Taille de la charge utile de la demande : la charge utile totale du corps de la requête pour Gemma 4 E2B, images et vidéos comprises, prend en charge une taille maximale de 3,5 Mo.