Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Terminales compatibles con Amazon Bedrock
Amazon Bedrock admite varios puntos de enlace para realizar operaciones de inferencia. Realizar solicitudes de inferencia
Operaciones de inferencia
Para aplicaciones nuevas, recomendamos el bedrock-runtime punto final. Es compatible con las Bedrock-native InvokeModel API de Converse, las API de OpenAI-compatible respuestas y finalización de chat y la API de mensajes antrópicos, y es allí donde están disponibles las funciones de Amazon Bedrock, como las barreras de protección, el enrutamiento rápido inteligente y la inferencia interregional. Dirige las solicitudes de inferencia de modelos Regiones de AWS con inferencia interregional Amazon Bedrock también admite un segundo punto finalbedrock-mantle, que actualmente ofrece capacidades adicionales, como el uso de herramientas preconfiguradas y del lado del servidor (incluida la búsqueda en la web), la inferencia asincrónica y la creación de proyectos y espacios de trabajo. background=true Para ver qué punto final admite cada modelo, consulte. Disponibilidad de terminales por modelos
| Punto de conexión | API compatibles | Descripción |
|---|---|---|
bedrock-runtime.{region}.amazonaws.com (recomendado) |
InvokeModel/Converse//Finalizaciones de chat/API de respuestas /API de mensajes Inferencia mediante la API de mensajes antrópicos | Region-specific puntos de conexión para realizar solicitudes de inferencia para modelos alojados en Amazon Bedrock mediante las API. InvokeModel/Converse/Chat Completions/Responses/Messages Para obtener más información sobre Bedrock-native las operaciones, consulte las operaciones de la API de Amazon Bedrock Runtime. Las OpenAI-compatible API se invocan en las /openai/v1 rutas de este punto final y no a través de los AWS SDK. |
bedrock-mantle.{region}.api.aws |
API de respuestas/API de finalización de API de finalización de chat en el punto final de Bedrock-mantle chats/API de mensajes Inferencia mediante la API de mensajes antrópicos | Region-specific puntos de enlace para realizar solicitudes de inferencia para modelos alojados en Amazon Bedrock mediante los OpenAI-compatible puntos de enlace y la API de mensajes antrópicos. |
Las aplicaciones existentes que se utilizan bedrock-mantle siguen siendo totalmente compatibles y no es necesario cambiarlas. Ambos puntos de enlace permiten incorporar una base de código del SDK de OpenAI existente a Amazon Bedrock cambiando únicamente la URL y la clave de API básicas, y ambos admiten las API de OpenAI-compatible respuestas y finalización de chat y la API de mensajes antrópicos.
En las tablas siguientes se compara lo que está disponible en cada punto final.
| API | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| InvokeModel | ||
| Converse/ ConverseStream | ||
| Finalizaciones de chat () OpenAI-compatible | ||
| API de respuestas () OpenAI-compatible | ||
| API de mensajes (Anthropic-native) |
nota
La API de mensajes está disponible en ambos terminales, pero las dos superficies no admiten funciones idénticas. En particular, no se admiten las salidas estructuradas (el output_config.format parámetro)bedrock-mantle; las solicitudes que incluyen output_config.format se rechazan con un error 400. Para usar salidas estructuradas con modelos de Anthropic Claude, activa las Converse o InvokeModel las API. bedrock-runtime
nota
La API Responses también está disponible en ambos terminales sin ofrecer funciones idénticas. En bedrock-runtime:
Las solicitudes son siempre sincrónicas.
background=truese rechaza con un error 400. Elstoreparámetro no se ve afectado y mantiene su valor predeterminadotrue, por lo que las conversaciones almacenadas en varios turnos funcionan con normalidad.Server-side El uso de herramientas y las herramientas preconfiguradas no están disponibles, incluida la búsqueda en la web. Client-side el uso de la herramienta funciona en ambos puntos finales.
Solo se admite el proyecto predeterminado. Consulte Proyectos (OpenAI-compatible).
Una respuesta almacenada pertenece a la persona Región de AWS que la entregó. Esa región se encarga de recuperarlo, cancelarlo o eliminarlo y continuar la conversación con
previous_response_idél.
| Funcionalidad | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Cross-region inferencia (perfiles geográficos y globales) | ||
| Gestión de conversaciones con estado | ||
| Inferencia asincrónica (de larga duración) | ||
| Client-side uso de herramientas | ||
| Server-side uso de herramientas | ||
| Pre-configured herramientas listas para usar | ||
| Proyectos | Solo proyecto predeterminado | |
| Espacios de trabajo |
| Elemento | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Autenticación AWS SigV4 | ||
| Clave de API de Bedrock (también funciona con el SDK de OpenAI) | ||
| Atribución de uso | Principal de IAM, etiquetado de metadatos por solicitud, perfiles de inferencia de aplicaciones Perfiles de inferencia de aplicaciones | Proyectos (OpenAI-compatible)Proyectos, espacios de trabajo |
nota
Si está activadabedrock-runtime, la API Responses atribuye el uso únicamente por parte del director de IAM. Per-request El etiquetado de metadatos y los perfiles de inferencia de aplicaciones no están disponibles en ella: se rechaza una solicitud en la que se nombra un perfil de inferencia de una aplicación como objetivo de inferencia y se produce un error 400. Esto no afecta a la inferencia entre regiones: los perfiles de inferencia geográficos y globales definidos por el sistema funcionan con normalidad.
| Característica | bedrock-runtime |
bedrock-mantle |
|---|---|---|
| Barandas | ||
| Almacenamiento en caché rápido | ||
| Enrutamiento rápido inteligente |
nota
La compatibilidad con el almacenamiento rápido en caché bedrock-mantle depende del modelo específico; consulte cada modelo de tarjeta en la sección siguiente Modelos de un vistazo para obtener más información.
Enfoque de rendimiento y cuota
Cada punto final utiliza un enfoque diferente para administrar el rendimiento.
-
bedrock-runtime— En muchos servicios multiusuario tradicionales, la arquitectura está diseñada en torno a cuotas por cuenta para gestionar un acceso equitativo a los recursos compartidos. Este es el enfoque que se utiliza con.bedrock-runtimeCada modelo tiene cuotas de rendimiento fijas (RPM y TPM) para las que puede solicitar aumentos. Para obtener más información, consulte Cuotas para el punto final de ejecución básico. -
bedrock-mantle— Este punto final está diseñado con mecanismos avanzados de programación y espera de trabajos que permiten una distribución equitativa de la distribución y, al mismo tiempo, admiten límites de rendimiento iniciales más altos. Este diseño tambiénbedrock-mantlepermite alojar un amplio conjunto de modelos y ofrecer toda la gama de capacidades disponibles en el catálogo de modelos. En la mayoría de los casos, las solicitudes se atienden de inmediato. En algunos casos, una solicitud puede quedar en cola brevemente mientras se completan las cargas de trabajo en curso y el rendimiento está disponible. Para más detalles, consulte Cuotas para el punto final entre el lecho rocoso y el manto y Mejores prácticas de escalado y rendimiento.
Precios
Per-token los precios del mismo modelo son idénticos en y. bedrock-runtime bedrock-mantle Elija un punto final en función de las API y las capacidades que necesita, no en función del costo. Para ver los precios actuales, consulte los precios de
¿Cuándo elegir cada punto final
Empieza bedrock-runtime cuando quieras:
Llama a las API de OpenAI-compatible respuestas o de finalización del chat, o a la API de mensajes antrópicos.
Usa las API Bedrock-native InvokeModel o las de Converse.
Utilice las funciones de Amazon Bedrock que solo están disponibles en este punto final, como las barreras de protección y el enrutamiento rápido inteligente.
Utilice la inferencia interregional para enrutar las solicitudes a través de una ubicación geográfica o global.
bedrock-mantleUtilízala cuando quieras:
Cree flujos de trabajo para agencias con el uso de herramientas del lado del servidor o herramientas preconfiguradas, incluida la búsqueda en la web. Búsqueda en la web
Ejecute cargas de trabajo de inferencia asincrónicas o de larga duración, incluidas las solicitudes de respuestas con.
background=trueCree Proyectos (OpenAI-compatible) o aísle cargas Espacios de trabajo () Anthropic-compatible de trabajo y realice un seguimiento de los costos y el uso a nivel de la aplicación.
Utilice un modelo que solo esté disponible en
bedrock-mantle. Consulte Disponibilidad de terminales por modelos.
Ambos terminales se pueden usar juntos desde la misma aplicación; elija para cada caso de uso.
Reduzca los costos de salida de datos con los puntos finales de la interfaz de VPC
Si llama a Amazon Bedrock desde una VPC, considere la posibilidad de utilizar puntos de enlace de interfaz de VPC (AWS PrivateLink) para mantener el tráfico dentro de la red de AWS y evitar los cargos por salida de datos asociados a las pasarelas NAT o pasarelas de Internet.