Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Gemma 4 E2B
Google — Gemma 4 E2B
Detalles del modelo
Gemma 4 E2B es el modelo compacto de Google, con 5 100 millones de parámetros en total y 2 300 millones de parámetros efectivos que utilizan Per-Layer Embeddings (PLE), y está diseñado para cargas de trabajo de baja latencia con razonamiento integrado, llamadas a funciones nativas y entrada multimodal de texto e imagen, que admite una ventana de contexto de 128 000 fichas. Para obtener más información sobre el desarrollo y el rendimiento del modelo, consulta la tarjeta. model/service
Fecha de lanzamiento del modelo: 10 de junio de 2025
Fecha de fin de vida útil del modelo: N/A
Contratos de licencia de usuario final y condiciones de uso: Ver https://ai.google.dev/gemma/apache_2
Ciclo de vida del modelo: activo
Ventana de contexto: 128 000 tokens
| Modalidades de entrada | Modalidades de salida | API compatibles | Endpoints compatibles |
|---|---|---|---|
Responses | bedrock-runtime | ||
Chat Completions | bedrock-mantle | ||
Invoke | |||
Converse | |||
Messages |
nota
Los modelos Gemma 4 solo están disponibles en el bedrock-mantle terminal.
Si está activadobedrock-mantle, este modelo se sirve en/openai/v1/responses, no en el predeterminado/v1/responses.
Capacidades y características
Características de Bedrock
Funciones compatibles con el punto final bedrock-mantle
| Soportado | No es compatible |
|---|---|
|
— |
Precios
Para obtener información sobre precios, consulte la página de precios de
Acceso programático
Utilice los siguientes ID de modelo y URL de punto final para acceder a este modelo mediante programación. Para obtener más información sobre las API y los puntos de conexión disponibles, consulte las API compatibles y los puntos de conexión compatibles. bedrock/latest/userguide/endpoints.html
| Punto de conexión | ID del modelo | In-Region URL de punto final | ID de inferencia geográfica | ID de inferencia global |
|---|---|---|---|---|
bedrock-mantle |
google.gemma-4-e2b |
https://bedrock-mantle.{region}.api.aws/openai/v1 |
No admitido | No admitido |
Por ejemplo, si la región es us-east-1 (norte de Virginia), la URL del punto final de Bedrock-mantle será "». https://bedrock-mantle.us-east-1.api.aws/openai/v1
Niveles de servicio
Amazon Bedrock ofrece varios niveles de servicio para adaptarse a sus requisitos de carga de trabajo. La versión estándar proporciona acceso de pago por token sin compromiso (defina "service_tier": "default" u omita el campo). Priority ofrece los tiempos de respuesta más rápidos por un precio superior (fijo). "service_tier": "priority" Flex proporciona un acceso de menor costo para cargas de trabajo flexibles y que no requieren tiempo (conjunto). "service_tier": "flex" Reserved proporciona un rendimiento dedicado con un compromiso temporal para cargas de trabajo predecibles; se establece a nivel de cuenta y no por solicitud (póngase en contacto con su equipo de cuentas de AWS para habilitarlo). Para obtener más información, consulte los niveles de servicio.
| Estándar | Priority (Prioridad) | Flex | Reservado |
|---|---|---|---|
Disponibilidad regional
La disponibilidad regional de un vistazo
Amazon Bedrock ofrece tres opciones de inferencia: In-Region mantiene las solicitudes en una sola región para garantizar un cumplimiento estricto, Cross-Region rutas geográficas entre regiones de una misma geografía (como EE. UU., UE y APAC) respetando la residencia de los datos, y Cross-Region rutas globales a cualquier parte del mundo cuando no hay restricciones de residencia. Consulte la Disponibilidad regional por modelos página para obtener más información.
| Region | In-Region | Geo | Global |
|---|---|---|---|
us-east-1(Virginia del Norte) | |||
us-east-2(Ohio) | |||
us-west-2(Oregón) | |||
eu-central-1(Fráncfort) |
Cuotas y límites
Su AWS cuenta tiene cuotas predeterminadas para mantener el rendimiento del servicio y garantizar el uso adecuado de Amazon Bedrock. Las cuotas predeterminadas asignadas a una cuenta pueden actualizarse en función de factores regionales, el historial de pagos, el uso fraudulento y la and/or aprobación de una solicitud de aumento de cuota. Para obtener más información, consulta la Cuotas para Amazon Bedrock documentación y los límites del modelo.
Cuando se consume el rendimiento bajo demanda en el bedrock-mantle terminal, el rendimiento disponible aumenta con el tiempo. No se garantiza que todas las solicitudes que estén dentro de su cuota tengan éxito durante los períodos de alta demanda, por lo que es importante aumentarlas gradualmente. En este modelo, los límites predeterminados no se determinan directamente a través de las cuotas de servicio, por lo que te recomendamos que sigas esta rampa como guía.
Código de muestra
Paso 1: AWS Cuenta: Si ya tienes una AWS cuenta, omite este paso. Si es la primera vez que lo AWS hace, regístrese para obtener una cuenta de AWS
Paso 2: clave de API: vaya a la consola de Amazon Bedrock
Paso 3: Obtenga el SDK: para utilizar esta guía de inicio, debe tener Python ya instalado. A continuación, instale el software correspondiente en función de las API que esté utilizando.
pip install openai
Paso 4: Configure las variables de entorno: configure su entorno para usar la clave de API para la autenticación.
OPENAI_API_KEY="<provide your Bedrock API key>" OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/openai/v1"
Paso 5: Ejecute su primera solicitud de inferencia: guarde el archivo como bedrock-first-request.py
Consideraciones y limitaciones de uso
Modo de razonamiento: tanto en la API de finalización como en la de respuestas del chat se respeta el esfuerzo de razonamiento, y el modelo realiza el razonamiento extendido en ambos casos. Sin embargo, el contenido del razonamiento solo lo devuelve la API de respuestas. La API de finalización del chat no devuelve los tokens de razonamiento, porque la especificación de finalización del chat de OpenAI no admite la devolución de los mismos.
Esfuerzo de razonamiento: para Gemma 4 E2B, recomendamos configurarlo en, lo que habilita el modo
reasoning_effortdehighpensamiento. Esta variante tiende a razonar extensamente de forma predeterminada, y un esfuerzo de razonamiento elevado mantiene ese razonamiento en el canal de razonamiento específico, lo que mejora la calidad del resultado y evita que el texto de razonamiento aparezca en la respuesta final.Llamadas de herramientas paralelas: actualmente no se admite la solicitud de más de una llamada de herramientas en un solo turno. Solicite las llamadas a las herramientas de una en una.
Tamaño de la carga útil de la solicitud: la carga útil total de la solicitud de Gemma 4 E2B, incluidas las imágenes y los vídeos, admite un tamaño máximo de 3,5 MB.