View a markdown version of this page

Gemma 4 E2B - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Gemma 4 E2B

Logotipo de Google con icono de letra G multicolor. Google — Gemma 4 E2B

Detalles del modelo

Gemma 4 E2B es el modelo compacto de Google, con 5 100 millones de parámetros en total y 2 300 millones de parámetros efectivos que utilizan Per-Layer Embeddings (PLE), y está diseñado para cargas de trabajo de baja latencia con razonamiento integrado, llamadas a funciones nativas y entrada multimodal de texto e imagen, que admite una ventana de contexto de 128 000 fichas. Para obtener más información sobre el desarrollo y el rendimiento del modelo, consulta la tarjeta. model/service

  • Fecha de lanzamiento del modelo: 10 de junio de 2025

  • Fecha de fin de vida útil del modelo: N/A

  • Contratos de licencia de usuario final y condiciones de uso: Ver https://ai.google.dev/gemma/apache_2

  • Ciclo de vida del modelo: activo

  • Ventana de contexto: 128 000 tokens

Modalidades de entrada Modalidades de salida API compatibles Endpoints compatibles
Green circle with white checkmark icon.AudioRed circle with white X icon indicating error, cancel, or close action.IncrustaciónGreen circle with white checkmark icon. ResponsesRed circle with white X icon indicating error, cancel, or close action. bedrock-runtime
Green circle with white checkmark icon.ImagenRed circle with white X icon indicating error, cancel, or close action.ImagenGreen circle with white checkmark icon. Chat CompletionsGreen circle with white checkmark icon. bedrock-mantle
Red circle with white X icon indicating error, cancel, or close action.DiscursoRed circle with white X icon indicating error, cancel, or close action.DiscursoRed circle with white X icon indicating error, cancel, or close action. Invoke
Green circle with white checkmark icon.TextoGreen circle with white checkmark icon.TextoRed circle with white X icon indicating error, cancel, or close action. Converse
Green circle with white checkmark icon.VídeoRed circle with white X icon indicating error, cancel, or close action.VídeoRed circle with white X icon indicating error, cancel, or close action. Messages
nota

Los modelos Gemma 4 solo están disponibles en el bedrock-mantle terminal.

Si está activadobedrock-mantle, este modelo se sirve en/openai/v1/responses, no en el predeterminado/v1/responses.

Capacidades y características

Características de Bedrock

Funciones compatibles con el punto final bedrock-mantle

Precios

Para obtener información sobre precios, consulte la página de precios de Amazon Bedrock.

Acceso programático

Utilice los siguientes ID de modelo y URL de punto final para acceder a este modelo mediante programación. Para obtener más información sobre las API y los puntos de conexión disponibles, consulte las API compatibles y los puntos de conexión compatibles. bedrock/latest/userguide/endpoints.html

Punto de conexión ID del modelo In-Region URL de punto final ID de inferencia geográfica ID de inferencia global
bedrock-mantle google.gemma-4-e2b https://bedrock-mantle.{region}.api.aws/openai/v1 No admitido No admitido

Por ejemplo, si la región es us-east-1 (norte de Virginia), la URL del punto final de Bedrock-mantle será "». https://bedrock-mantle.us-east-1.api.aws/openai/v1

Niveles de servicio

Amazon Bedrock ofrece varios niveles de servicio para adaptarse a sus requisitos de carga de trabajo. La versión estándar proporciona acceso de pago por token sin compromiso (defina "service_tier": "default" u omita el campo). Priority ofrece los tiempos de respuesta más rápidos por un precio superior (fijo). "service_tier": "priority" Flex proporciona un acceso de menor costo para cargas de trabajo flexibles y que no requieren tiempo (conjunto). "service_tier": "flex" Reserved proporciona un rendimiento dedicado con un compromiso temporal para cargas de trabajo predecibles; se establece a nivel de cuenta y no por solicitud (póngase en contacto con su equipo de cuentas de AWS para habilitarlo). Para obtener más información, consulte los niveles de servicio.

Estándar Priority (Prioridad) Flex Reservado
Green circle with white checkmark icon. Green circle with white checkmark icon. Green circle with white checkmark icon. Red circle with white X icon indicating error, cancel, or close action.

Disponibilidad regional

La disponibilidad regional de un vistazo

Amazon Bedrock ofrece tres opciones de inferencia: In-Region mantiene las solicitudes en una sola región para garantizar un cumplimiento estricto, Cross-Region rutas geográficas entre regiones de una misma geografía (como EE. UU., UE y APAC) respetando la residencia de los datos, y Cross-Region rutas globales a cualquier parte del mundo cuando no hay restricciones de residencia. Consulte la Disponibilidad regional por modelos página para obtener más información.

Region In-Region Geo Global
us-east-1(Virginia del Norte)Green circle with white checkmark icon.Red circle with white X icon indicating error, cancel, or close action.Red circle with white X icon indicating error, cancel, or close action.
us-east-2(Ohio)Green circle with white checkmark icon.Red circle with white X icon indicating error, cancel, or close action.Red circle with white X icon indicating error, cancel, or close action.
us-west-2(Oregón)Green circle with white checkmark icon.Red circle with white X icon indicating error, cancel, or close action.Red circle with white X icon indicating error, cancel, or close action.
eu-central-1(Fráncfort)Green circle with white checkmark icon.Red circle with white X icon indicating error, cancel, or close action.Red circle with white X icon indicating error, cancel, or close action.

Cuotas y límites

Su AWS cuenta tiene cuotas predeterminadas para mantener el rendimiento del servicio y garantizar el uso adecuado de Amazon Bedrock. Las cuotas predeterminadas asignadas a una cuenta pueden actualizarse en función de factores regionales, el historial de pagos, el uso fraudulento y la and/or aprobación de una solicitud de aumento de cuota. Para obtener más información, consulta la Cuotas para Amazon Bedrock documentación y los límites del modelo.

Cuando se consume el rendimiento bajo demanda en el bedrock-mantle terminal, el rendimiento disponible aumenta con el tiempo. No se garantiza que todas las solicitudes que estén dentro de su cuota tengan éxito durante los períodos de alta demanda, por lo que es importante aumentarlas gradualmente. En este modelo, los límites predeterminados no se determinan directamente a través de las cuotas de servicio, por lo que te recomendamos que sigas esta rampa como guía.

Código de muestra

Paso 1: AWS Cuenta: Si ya tienes una AWS cuenta, omite este paso. Si es la primera vez que lo AWS hace, regístrese para obtener una cuenta de AWS.

Paso 2: clave de API: vaya a la consola de Amazon Bedrock y genere una clave de API a largo plazo.

Paso 3: Obtenga el SDK: para utilizar esta guía de inicio, debe tener Python ya instalado. A continuación, instale el software correspondiente en función de las API que esté utilizando.

pip install openai

Paso 4: Configure las variables de entorno: configure su entorno para usar la clave de API para la autenticación.

OPENAI_API_KEY="<provide your Bedrock API key>" OPENAI_BASE_URL="https://bedrock-mantle.<your-region>.api.aws/openai/v1"

Paso 5: Ejecute su primera solicitud de inferencia: guarde el archivo como bedrock-first-request.py

Chat Completions API
from openai import OpenAI client = OpenAI() response = client.chat.completions.create( model="google.gemma-4-e2b", messages=[{"role": "user", "content": "Can you explain the features of Amazon Bedrock?"}] ) print(response)
Responses API
from openai import OpenAI client = OpenAI() response = client.responses.create( model="google.gemma-4-e2b", input="Explain the benefits of mixture-of-experts architectures for production inference.", max_output_tokens=512, ) print(response.output_text)

Consideraciones y limitaciones de uso

  • Modo de razonamiento: tanto en la API de finalización como en la de respuestas del chat se respeta el esfuerzo de razonamiento, y el modelo realiza el razonamiento extendido en ambos casos. Sin embargo, el contenido del razonamiento solo lo devuelve la API de respuestas. La API de finalización del chat no devuelve los tokens de razonamiento, porque la especificación de finalización del chat de OpenAI no admite la devolución de los mismos.

  • Esfuerzo de razonamiento: para Gemma 4 E2B, recomendamos configurarlo en, lo que habilita el modo reasoning_effort de high pensamiento. Esta variante tiende a razonar extensamente de forma predeterminada, y un esfuerzo de razonamiento elevado mantiene ese razonamiento en el canal de razonamiento específico, lo que mejora la calidad del resultado y evita que el texto de razonamiento aparezca en la respuesta final.

  • Llamadas de herramientas paralelas: actualmente no se admite la solicitud de más de una llamada de herramientas en un solo turno. Solicite las llamadas a las herramientas de una en una.

  • Tamaño de la carga útil de la solicitud: la carga útil total de la solicitud de Gemma 4 E2B, incluidas las imágenes y los vídeos, admite un tamaño máximo de 3,5 MB.