View a markdown version of this page

Cuotas para el punto final de ejecución básico - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Cuotas para el punto final de ejecución básico

El bedrock-runtime.region.amazonaws.com punto final es el punto final de inferencia principal de Amazon Bedrock. El tráfico de inferencia a este punto final se rige por cuotas basadas en tokens por modelo. Puede ver estas cuotas en la consola de cuotas de servicio seleccionando Amazon Bedrock como servicio o en la tabla de cuotas de servicio de Amazon Bedrock de. Referencia general de AWS

nota

Las cuotas de un modelo en este punto final se comparten en todas las API de inferencia con las que lo llames, incluidas las de Converse InvokeModel , Responses y Chat Finations. Aunque los nombres de las cuotas hagan referencia aInvokeModel, no son por API. El tráfico al bedrock-mantle punto final se cuenta por separado; consulteCuotas para el punto final entre el lecho rocoso y el manto.

Tipos de cuotas

La inferencia en el bedrock-runtime punto final se rige por las siguientes cuotas por modelo:

cuotas de tiempo de ejecución básicas por modelo
Cuota Alcance Description (Descripción)
Cross-Region InvokeModel fichas por minuto para ${model} Por modelo, por región La cantidad máxima de tokens por minuto (entrada y salida, combinadas) que su cuenta puede usar para el modelo cuando se invoca a través de un perfil de inferencia interregional.
On-demand InvokeModel fichas por minuto para ${model} Por modelo, por región La cantidad máxima de tokens por minuto (entrada y salida, combinadas) que tu cuenta puede usar para el modelo cuando se invoca bajo demanda en una sola región.
Número máximo de tokens de invocación del modelo por día para ${model} Por modelo, por región La cantidad máxima de fichas por día (entrada y salida, combinadas) que tu cuenta puede usar para el modelo. De forma predeterminada, este valor es la cuota por minuto multiplicada por 24 × 60. Los nuevos Cuentas de AWS podrían recibir cuotas reducidas.
InvokeModel solicitudes por minuto para ${model} Por modelo, por región La cantidad máxima de solicitudes de inferencia por minuto que su cuenta puede enviar para el modelo. El RPM se aplica a algunos modelos en el bedrock-runtime punto final y no a otros; consulte la consola de cuotas de servicio para ver las cuotas exactas que se aplican a su modelo.

Las cuotas de TPM de bedrock-runtime punto final suman los tokens de entrada y salida para compararlos con una cuota única por modelo. El bedrock-mantle punto final aplica cuotas separadas de fichas de entrada por minuto y de fichas de salida por minuto; para obtener más información, consulte. Cuotas para el punto final entre el lecho rocoso y el manto

nota

Las cuotas bedrock-runtime de RPM en el punto final son específicas del modelo. Algunos modelos (por ejemplo, Anthropic Claude Opus 4.7 y Claude Opus 4.8) no tienen una cuota de RPM y se rigen únicamente por las cuotas basadas en fichas que se describen en esta sección. En el caso de los modelos que sí tienen una cuota de RPM, consulta el valor exacto en la consola de cuotas de servicio.

Los tokens de salida se convierten en cuotas de uso mediante una tasa de agotamiento específica para cada modelo. Para obtener más información sobre cómo se calculan las cuotas basadas en fichas y cómo el parámetro de max_tokens solicitud afecta a las deducciones, consulte. Contabilización de los tokens en Amazon Bedrock

Cuotas de tiempo de ejecución relacionadas

Las siguientes capacidades de Amazon Bedrock se ofrecen a través del bedrock-runtime punto final y tienen sus propias cuotas independientes:

Estas cuotas se aplican solo al bedrock-runtime punto final y no están expuestas en el punto final. bedrock-mantle

Solicitud de aumento de cuota

Los pasos para solicitar un aumento de cuota para su cuenta dependen del valor que aparezca en la columna Ajustable de la tabla de cuotas de las cuotas de servicio de Amazon Bedrock.

importante

Antes de solicitar un aumento de cuota, compruebe que el modelo no esté en estado de ciclo de vida heredado o obsoleto. No se conceden aumentos de cuota a los modelos cuya retirada está prevista. Compruebe el estado del ciclo de vida del modelo en la Ciclo de vida del modelo página y, en su lugar, considere la posibilidad de migrar al modelo sucesor.

  • Si una cuota está marcada como , puede ajustarla siguiendo los pasos de Solicitud de un aumento de cuota en la Guía del usuario de Service Quotas.

  • Para cualquier modelo, puede solicitar un aumento de las cuotas siguientes:

    • Cross-Region InvokeModel fichas por minuto para ${model}

    • On-demand InvokeModel fichas por minuto para ${model}

    • Modelo: número máximo de tokens de invocación por día para ${model}

    Para solicitar un aumento para cualquier combinación de estas cuotas, solicita un aumento de los Cross-Region InvokeModel tokens por minuto de ${model} cuota siguiendo los pasos que se indican en la Guía del usuario sobre las cuotas de servicio para solicitar un aumento de cuota. Después de hacerlo, el equipo de soporte se pondrá en contacto contigo y te ofrecerá la opción de aumentar también las otras dos cuotas.

    nota

    Debido a la abrumadora demanda, se dará prioridad a los clientes que generen tráfico que consuma la cuota que tienen asignada. La solicitud se denegará si no cumple esta condición.

Para ver los aumentos de bedrock-mantle cuota, consulteSolicitud de aumento de cuota.