Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Cuotas para el punto final entre el lecho rocoso y el manto
El bedrock-mantle. punto final funciona con la API de OpenAI respuestas, la API de finalización de OpenAI chats y la API de mensajes antrópicos. El tráfico de inferencia a este punto final se rige por un conjunto de cuotas independiente del punto final. region.api.awsbedrock-runtime
Para ver bedrock-mantle las cuotas en la consola de Service Quotas, seleccione Amazon Bedrock como servicio y busque Bedrock Mantle. Para solicitar un aumento de cualquiera de estas cuotas, consulte. Solicitud de aumento de cuota
Tipos de cuotas
La inferencia en el bedrock-mantle punto final se rige por dos cuotas por modelo:
| Cuota | Alcance | Description (Descripción) |
|---|---|---|
Bedrock Mantle introduce fichas por minuto para ${model} |
Por modelo, por región | El número máximo de fichas de entrada por minuto que su cuenta puede enviar al modelo en el bedrock-mantle punto final. Se comparte en todas las API atendidas por el punto final de ese modelo. |
Bedrock Mantle genera fichas por minuto para ${model} |
Por modelo, por región | El número máximo de fichas de salida por minuto que el modelo puede generar para su cuenta en el bedrock-mantle punto final. Se comparte en todas las API atendidas por el punto final de ese modelo. |
nota
Los tokens de entrada en caché que se leen mediante el almacenamiento en caché rápido no se tienen en cuenta para la cuota de entradas por minuto.
nota
El bedrock-mantle punto final no aplica cuotas de solicitudes por minuto (RPM). La limitación se rige únicamente por las cuotas de entradas y salidas que se describen en esta sección.
Cómo se evalúan las solicitudes en relación con las cuotas
Cuando envía una solicitud de inferencia al bedrock-mantle punto final, la AWS evalúa comparándola con sus cuotas en el siguiente orden:
-
Fichas de entrada por minuto: la cantidad de fichas de entrada de la solicitud, más el valor
max_tokens(o el máximo específico del modelo si nomax_tokensestá establecido), se comparan con la cuota de fichas de entrada por minuto del modelo solicitado. Si la admisión de la solicitud superaría la cuota, se limitará la solicitud con una respuesta HTTP 429. -
Símbolos de salida por minuto: a medida que el modelo transmite o genera resultados, los identificadores de salida se tienen en cuenta para descontar la cuota de símbolos de salida por minuto de ese modelo. Si se alcanza la cuota durante la generación, la generación se detiene y se devuelve la respuesta con un motivo de finalización que indica el límite.
Una vez completada la respuesta, cualquier parte no utilizada de la reserva inicial de fichas de entrada (la diferencia entre la salida real max_tokens y la salida real) se repondrá en su cuota.
El punto final puede aplicar una limitación de velocidad interna adicional que no esté expuesta en Service Quotas. Utilice la lógica de reintento con retroceso exponencial para gestionar la limitación transitoria.
Las cuotas de TPM del bedrock-runtime punto final cuentan los tokens de entrada y salida de forma conjunta en función de una cuota única por modelo, mientras que el punto final aplica cuotas independientes de entradas por minuto y de salida por minutobedrock-mantle. Si ejecuta cargas de trabajo en ambos puntos finales, planifique la capacidad de cada uno de ellos de forma independiente. Para obtener más información sobre las cuotas de los terminales de ejecución, consulte. Cuotas para el punto final de tiempo de ejecución fundamental
Valores de cuota predeterminados
En la siguiente tabla, se muestran las cuotas predeterminadas para los modelos del bedrock-mantle punto final. Cuentas de AWS Es posible que las nuevas reciban cuotas reducidas y las cuotas pueden variar según la región.
| Modelo | TPM de entrada predeterminado | TPM de salida predeterminado |
|---|---|---|
| AnthropicClaude Opus 4.7 | 20.000.000 | 4.000.000 |
Los modelos adicionales aparecerán en esta tabla a medida que se lancen en el dispositivo de punto final.
Modelos sin cuotas de TPM publicadas
El bedrock-mantle punto final aplica las cuotas de TPM publicadas solo para los modelos que se enumeran en la tabla anterior. Otros modelos que se ofrecen en este punto final no tienen cuotas de TPM por cuenta expuestas en Service Quotas en la actualidad; su rendimiento se rige por la capacidad del servicio interno. AWS podría introducir cuotas por cuenta para modelos adicionales a medida que aumente el uso. Utilice la lógica de reintento con retroceso exponencial para gestionar la limitación transitoria. Si necesitas una cuota publicada para un modelo específico, ponte en contacto con AWS Support.
Regiones admitidas
bedrock-mantlelas cuotas están visibles en Service Quotas en las mismas AWS regiones en las que está disponible el bedrock-mantle punto final. Para ver la lista completa de regiones y direcciones URL de puntos finales, consulteRegiones y puntos finales compatibles.
Solicitud de aumento de cuota
Las bedrock-mantle cuotas están visibles en Service Quotas, pero las solicitudes de aumento de cuota no se procesan actualmente a través de la consola Service Quotas. Para solicitar un aumento, envía una solicitud a través del formulario AWS Support limit increase
-
El punto final (
bedrock-mantle). -
La región de .
-
El modelo.
-
El nombre de la cuota (TPM de entrada o TPM de salida) y el valor que solicita.
Puede solicitar aumentos de los tokens de entrada por minuto y los de salida por minuto para el mismo modelo en un único caso de soporte. La aprobación depende de si su uso actual justifica el aumento, por lo que debe incluir información sobre el uso reciente de la consola Service Quotas CloudWatch o de la consola Service Quotas en su solicitud.
Diferencias con respecto a las cuotas de tiempo de ejecución fundamentales
Las bedrock-mantle cuotas son independientes de las cuotas. bedrock-runtime El tráfico de bedrock-runtime. entrada y el tráfico de destino region.amazonaws.com.rproxy.govskope.cabedrock-mantle. consumen asignaciones de cuotas distintas, incluso cuando se utiliza el mismo modelo subyacente.region.api.aws
Las cuotas de perfil de inferencia personalizadas, las cuotas de inferencia por lotes y las asignaciones de rendimiento aprovisionadas se aplican solo al bedrock-runtime punto final y no están expuestas en el punto final. bedrock-mantle