Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Métricas de límite de velocidad
Las entradas sobre el límite de velocidad especifican una o más métricas que definen lo que se mide y el período de tiempo para su cumplimiento. Cada tipo de métrica tiene restricciones específicas en cuanto a los períodos y tipos de objetivos admitidos.
Límites de frecuencia de solicitudes
Los límites de frecuencia de solicitudes controlan la cantidad de solicitudes de API permitidas dentro de un período de tiempo.
-
Períodos admitidos:
second,minute -
Tipos de objetivos compatibles: todos los tipos de objetivos
-
Establecer la velocidad en 0: bloquea todas las solicitudes coincidentes una vez que se completa la propagación (hasta 30 segundos)
Los límites de frecuencia de solicitudes se evalúan de forma sincrónica antes de que la solicitud se envíe al destino.
Límites de velocidad de los tokens
Los límites de velocidad de los tokens controlan la cantidad de tokens (entrada y salida) que se consumen en un período de tiempo. Los límites de velocidad de los tokens se aplican solo a los objetivos de inferencia.
-
Períodos admitidos:
minute -
Tipos de objetivos compatibles: solo objetivos de inferencia (objetivos de conectores y objetivos de proveedores con rutas de inferencia conocidas)
-
Rutas de inferencia conocidas:,,
/v1/chat/completions/v1/messages/v1/responses
Los límites de las tasas simbólicas utilizan una aplicación basada en el presupuesto:
-
La pasarela calcula el uso de los tokens de entrada antes de reenviar la solicitud.
-
El recuento real de tokens (entrada más salida) se registra una vez finalizada la respuesta.
-
Debido a la latencia de respuesta, es posible que el presupuesto supere temporalmente la tasa configurada antes de que la aplicación de la ley se ponga al día.
nota
En el caso de las solicitudes de finalización de chat en streaming (/v1/chat/completions), la pasarela se añade automáticamente "stream_options": {"include_usage": true} al cuerpo de la solicitud. Esto ocurre cuando el límite de velocidad de los tokens está activo y la opción aún no está presente. Garantiza que los recuentos de tokens precisos estén disponibles en la respuesta transmitida para la aplicación del TPM.
Límites de velocidad de conexión
Los límites de velocidad de conexión controlan la cantidad de solicitudes simultáneas durante el vuelo que se permiten en un momento dado. Cada solicitud ocupa un espacio de conexión desde su aceptación hasta que se completa la respuesta. Si llega una nueva solicitud y el número de conexiones activas ha alcanzado el límite configurado, la solicitud se rechaza con una respuesta HTTP 429.
-
Períodos admitidos:
second -
Tipos de objetivos compatibles: todos los tipos de objetivos (MCP, HTTP, inferencia)
-
Medición: número máximo de solicitudes simultáneas en vuelo
Restricciones métricas
| Métrica | Periodos compatibles | Objetivos compatibles |
|---|---|---|
|
|
|
Todos |
|
|
|
Solo objetivos de inferencia (conector, proveedor con rutas conocidas) |
|
|
|
Todos |
Métricas combinadas
Una sola entrada de límite de velocidad puede especificar varias métricas. Cuando una entrada tiene varias métricas, todas las métricas se evalúan de forma independiente; la solicitud se limita si alguna métrica supera su límite.
El siguiente ejemplo muestra un límite de frecuencia que impone tanto las solicitudes por minuto como los tokens por minuto:
{ "rateLimitId": "inference-rps-and-tpm", "dimensionKeys": ["targetName", "$.context.jwt.sub"], "entries": [ { "dimensions": { "targetName": "my-inference-target", "$.context.jwt.sub": "*" }, "requests": [{"rate": 300, "period": "minute"}], "tokens": [{"rate": 50000, "period": "minute"}] } ] }
En este ejemplo, cada persona que llama se limita si supera las 300 solicitudes por minuto o los 50 000 tokens por minutomy-inference-target, según el límite que se alcance primero.