View a markdown version of this page

Capacidad y rendimiento - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Capacidad y rendimiento

Amazon Bedrock ofrece opciones de capacidad flexibles para adaptarse a sus requisitos de carga de trabajo y a su presupuesto. Comprender las diferencias entre los niveles bajo demanda (Flex, Priority, Standard), los niveles reservados, el procesamiento por lotes y la inferencia interregional le ayuda a optimizar tanto el rendimiento como los costos.

Opciones de capacidad

Tipo de capacidad Caso de uso Características clave
On-Demand: Flex Cargas de trabajo esporádicas y de bajo volumen
  • El costo más bajo por token

  • Best-effort disponibilidad

  • Puede experimentar estrangulamiento

  • Sin SLA

On-Demand: Estándar Cargas de trabajo de producción regulares
  • Coste y rendimiento equilibrados

  • Garantías de rendimiento moderadas

  • SLA estándar

  • La opción más común

On-Demand: Prioridad High-priority, aplicaciones sensibles a la latencia
  • El costo más alto bajo demanda

  • Asignación de rendimiento superior

  • SLA mejorado

  • Reducción del riesgo de estrangulamiento

Nivel reservado Cargas de trabajo consistentes y de gran volumen
  • Unidades modelo reservadas

  • Capacidad garantizada

  • Compromisos de 1 o 3 meses

  • Rendimiento predecible

Lote Large-scale, procesamiento que no es urgente
  • Ahorro de costos del 50% en comparación con bajo demanda

  • Periodo de procesamiento de 24 horas

  • Ideal para inferencias masivas

Cross-Region Inferencia Cargas de trabajo que se pueden procesar fuera de una sola región
  • Dirige las solicitudes entre las regiones del perfil de inferencia

  • Reduce los costos de los tokens para algunos modelos con perfiles globales

  • Utiliza precios bajo demanda

Limita & las cuotas

On-Demand Límites (por nivel)

Nivel Rango de RPM Rango TPM Riesgo de estrangulación
Flexionar 10-100 5K-50K Alto
Standard 100-500 50 K-150K Medio
Priority (Prioridad) 500-1000 o más 150 + K-300K Bajo
  • Capacidad de ráfaga: disponible en todos los niveles para picos cortos

  • Límites flexibles: se pueden aumentar mediante solicitudes de cuotas de servicio

  • Model-specific: Los límites reales varían según el modelo básico

Límites de niveles reservados

  • Compromiso mínimo: 1 unidad modelo

  • Unidades máximas: específicas de la cuenta y de la región

  • Input/output límites de fichas: en función de las unidades compradas

  • No hay limitación de RPM dentro de la capacidad adquirida

Límites de procesamiento por lotes

  • Tamaño del trabajo: hasta 10 000 registros por lote

  • Tamaño del archivo: archivo de entrada máximo de 200 MB

  • Tiempo de procesamiento: ventana de finalización de 24 horas

  • Trabajos simultáneos: cuotas Region-specific

Cross-Region Inferencia

  • Hereda los límites de los niveles bajo demanda por región

  • Sin gastos adicionales de cuota

  • Enrutamiento automático (sin administración manual de límites)

Elegir un nivel

Marco de decisión

Escenario Opción recomendada ¿Por qué
Development/testing Flexionar El costo más bajo, aceptable para la no producción
Producción estándar Standard El mejor equilibrio costo-rendimiento
Aplicaciones críticas orientadas al usuario Priority (Prioridad) Fiabilidad y rendimiento por encima del coste
Carga constante de gran volumen Nivel reservado Ahorros del 30 al 50% con compromiso
Procesamiento masivo de datos Lote 50% de descuento para cargas de trabajo no urgentes
Mission-critical tiempo de actividad Cross-Region Inferencia Disponibilidad > costo

Estrategias de optimización

Elija el On-Demand nivel correcto

  • Comience con el estándar para la mayoría de las cargas de trabajo

  • Cambie a Flex para entornos dev/test

  • Actualice a Priority solo cuando la limitación afecte a los usuarios

  • Supervise las métricas CloudWatch de aceleración para tomar decisiones informadas

Transición al nivel reservado

  • Cuando la carga constante supera el 40% de los costos bajo demanda

  • Calcule el punto de equilibrio: (coste mensual bajo demanda) frente a (compromiso reservado)

  • Utilice inicialmente un compromiso de 1 mes

  • El nivel reservado puede funcionar junto con cualquier nivel bajo demanda

Usa Batch para

  • Generación de datos de entrenamiento

  • Retrasos en la moderación de contenido

  • Generación de informes

  • Canalizaciones de enriquecimiento de datos

Combine enfoques

  • Nivel reservado para el tráfico de referencia

  • Estándar bajo demanda para ráfagas moderadas

  • Prioridad bajo demanda durante los períodos de mayor actividad

  • Lote para procesamiento sin conexión

  • Utilice Cross-Region la inferencia para las cargas de trabajo que se pueden procesar fuera de una sola región.

Monitorización de costos

  • Compare los costos de los niveles: Flex < Standard < Priority

  • Realiza un seguimiento de los tokens por solicitud (optimiza las solicitudes)

  • Usa CloudWatch métricas para el uso y la limitación

  • Configura alarmas de facturación para los picos inesperados

  • Revisa el uso del nivel reservado mensualmente

  • Evalúe las mejoras de nivel solo cuando se produzca una limitación