Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Contabilización de los tokens en Amazon Bedrock
Cuando ejecuta la inferencia del modelo, hay cuotas en la cantidad de tokens que se pueden procesar en función del modelo de Amazon Bedrock que utilice. Consulte la siguiente terminología relacionada con las cuotas de tokens:
| Plazo | Definición |
|---|---|
InputTokenCount |
La métrica de tiempo de ejecución de CloudWatch Amazon Bedrock que representa el número de tokens de entrada procesados por el modelo, sin incluir los tokens almacenados en caché. Para determinar el consumo total de tokens de entrada con respecto a su cuota, sume. InputTokenCount + CacheWriteInputTokens |
OutputTokenCount |
La métrica de tiempo de ejecución de CloudWatch Amazon Bedrock que representa el número de tokens generados por el modelo en respuesta a una solicitud. |
CacheReadInputTokens |
La métrica de tiempo de ejecución de CloudWatch Amazon Bedrock que representa el número de tokens de entrada que se recuperaron correctamente de una caché en lugar de que el modelo los volviera a procesar. Este valor es 0 si no utiliza el almacenamiento en caché de peticiones. |
CacheWriteInputTokens |
La métrica de tiempo de ejecución de CloudWatch Amazon Bedrock que representa el número de tokens de entrada que se escribieron correctamente en la caché. Este valor es 0 si no utiliza el almacenamiento en caché de peticiones. |
| Tokens por minuto (TPM) | Una cuota establecida AWS a nivel de modelo en función del número de tokens (incluidos los de entrada y de salida) que puede usar en un minuto. |
| Tokens por día (TPD) | Una cuota establecida AWS a nivel de modelo sobre la cantidad de fichas (incluidas las entradas y las salidas) que puedes usar en un día. De forma predeterminada, este valor es TPM x 24 x 60. Sin embargo, las nuevas Cuentas de AWS tienen cuotas reducidas. |
max_tokens |
Un parámetro que se proporciona en la solicitud para establecer la cantidad máxima de tokens de salida que el modelo puede generar. |
| Velocidad de consumo | La velocidad a la que los tokens de entrada y salida se convierten en uso de cuota de tokens para el sistema de limitación. |
La tasa de desgaste de los modelos Anthropic Claude de la versión 4.8 es 15 veces mayor para las fichas de salida (1 ficha de salida consume 15 fichas de las cuotas) y la tasa de agotamiento del Sonnet 5 de Anthropic Claude es de 10 veces para las fichas de salida. La tasa de agotamiento de Anthropic Claude Opus 5 es 10 veces mayor que la de los tokens de salida. Para todos los demás modelos de Anthropic de la versión 4.7 y anteriores, el consumo de fichas de salida es 5 veces mayor (1 ficha de salida consume 5 fichas de tus cuotas).
En todos los demás modelos, la velocidad de consumo es de 1:1 (1 token de salida consume 1 token de su cuota).
Los porcentajes de consumo de fichas solo se aplican a los modelos disponibles en el terminal. bedrock-runtime Los modelos disponibles exclusivamente para bedrock-mantle terminales tienen cuotas separadas para los tokens de entrada y salida, por lo que no se aplica el agotamiento.
Temas
Administración de las cuotas de tokens
Cuando realiza una solicitud, los tokens se deducen de sus cuotas de TPM y TPD. Los cálculos se realizan en las siguientes etapas:
-
Al inicio de la solicitud: la siguiente suma se deduce de tus cuotas. La solicitud se limita si supera una cuota.
Total input tokens + max_tokens -
Durante el procesamiento: la cuota consumida por la solicitud se ajusta periódicamente para tener en cuenta la cantidad real de tokens de salida generados.
-
Al final de la solicitud:: la cantidad total de tokens consumidos por la solicitud se calculará de la siguiente manera y los tokens no utilizados se repondrán en su cuota:
InputTokenCount + CacheWriteInputTokens + (OutputTokenCount x burndown rate)CacheReadInputTokensno contribuyas a este cálculo y no se contabilizan para tu cuota. Si no utilizas el almacenamiento rápido en caché, ambos valoresCacheWriteInputTokensyCacheReadInputTokensserán 0.
nota
Solo se le facturará por el uso real de sus tokens.
Por ejemplo, si utiliza Anthropic Claude Sonnet 4 y envía una solicitud que contiene 1000 tokens de entrada y genera una respuesta equivalente a 100 tokens:
-
Se repondrán 1500 tokens (1000 + 100 x 5) de sus cuotas de TPM y TPD.
-
Solo se le facturarán 1100 tokens.
Impacto del parámetro max_tokens
El valor max_tokens se deduce de la cuota al principio de cada solicitud. Si alcanza las cuotas de TPM antes de lo esperado, intente reducir max_tokens para aproximarse mejor al tamaño de las finalizaciones.
Los siguientes escenarios ofrecen ejemplos de cómo habrían funcionado las deducciones de cuota en las solicitudes completadas si se hubiera utilizado un modelo que tuviera una velocidad de consumo de cinco veces para los tokens de salida:
Se presupone que se utilizan los siguientes parámetros:
-
InputTokenCount: 3.000
-
CacheReadInputTokens: 4.000
-
CacheWriteInputTokens: 1.000
-
OutputTokenCount: 1.000
-
max_tokens: 32 000
Se realizan las siguientes deducciones de cuota:
-
Deducción inicial cuando se hace la solicitud: 36 000 (= 3000 + 1000 + 32 000)
-
Deducción final ajustada una vez generada la respuesta: 9000 (= 3000 + 1000 + 1000 x 5)
En este escenario, se podrían realizar menos solicitudes simultáneas porque el parámetro max_tokens estaba establecido en un valor demasiado alto. Esto reduce la simultaneidad de las solicitudes, el rendimiento y el uso de las cuotas, ya que la capacidad de la cuota del TPM se alcanzaría rápidamente.
Se presupone que se utilizan los siguientes parámetros:
-
InputTokenCount: 3000
-
CacheReadInputTokens: 4.000
-
CacheWriteInputTokens: 1.000
-
OutputTokenCount: 1.000
-
max_tokens: 1250
Se realizan las siguientes deducciones de cuota:
-
Deducción inicial cuando se hace la solicitud: 5.250 (= 3.000 + 1.000 + 1.250)
-
Deducción final ajustada una vez generada la respuesta: 9000 (= 3000 + 1000 + 1000 x 5)
En este escenario, el parámetro max_tokens se optimizó, ya que la deducción inicial es solo ligeramente superior a la deducción ajustada final. Esto ayudó a aumentar la simultaneidad de las solicitudes, el rendimiento y el uso de las cuotas.
Optimización del parámetro max_tokens
Al optimizar el max_tokens parámetro, puede utilizar de manera eficiente la capacidad de cuota asignada. Para ayudarte a tomar una decisión sobre este parámetro, puedes usar Amazon CloudWatch, que recopila automáticamente las métricas de AWS los servicios, incluidos los datos de uso de los tokens en Amazon Bedrock.
Los tokens se registran en las métricas en tiempo de ejecución InputTokenCount y OutputTokenCount (para obtener más información, consulte Métricas en tiempo de ejecución de Amazon Bedrock.
Para utilizar la CloudWatch monitorización como base para tomar una decisión sobre el max_tokens parámetro, haga lo siguiente Consola de administración de AWS en:
-
Inicia sesión en la CloudWatch consola de Amazon en https://console.aws.amazon.com/cloudwatch
. -
En el panel de navegación, seleccione Paneles.
-
Seleccione la pestaña Paneles automáticos.
-
Seleccione Bedrock.
-
En el panel Recuentos de tokens por modelo, seleccione el icono de expansión.
-
Seleccione parámetros de duración temporal e intervalo para que las métricas tengan en cuenta los picos de uso.
-
En el menú desplegable Suma, puede elegir diferentes métricas para observar el uso de los tokens. Examine estas métricas para guiar su decisión a la hora de establecer el valor de
max_tokens.