As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Métricas de limite de taxa
As entradas de limite de taxa especificam uma ou mais métricas que definem o que está sendo medido e a janela de tempo para aplicação. Cada tipo de métrica tem restrições específicas sobre períodos suportados e tipos de metas.
Limites de taxa de solicitação
Os limites da taxa de solicitação controlam o número de solicitações de API permitidas em uma janela de tempo.
-
Períodos suportados:
second,minute -
Tipos de alvos suportados: Todos os tipos de alvos
-
Definindo a taxa como 0: bloqueia todas as solicitações correspondentes quando a propagação é concluída (até 30 segundos)
Os limites da taxa de solicitação são avaliados de forma síncrona antes que a solicitação seja encaminhada ao alvo.
Limites de taxa de token
Os limites da taxa de token controlam o número de tokens (entrada + saída) consumidos em uma janela de tempo. Os limites da taxa de token se aplicam somente aos alvos de inferência.
-
Períodos suportados:
minute -
Tipos de alvos compatíveis: somente alvos de inferência (alvos de conectores e alvos de provedores com caminhos de inferência conhecidos)
-
Caminhos de inferência conhecidos:
/v1/chat/completions,,/v1/messages/v1/responses
Os limites de taxa de token usam a fiscalização baseada no orçamento:
-
O gateway estima o uso do token de entrada antes de encaminhar a solicitação.
-
A contagem real de tokens (entrada + saída) é registrada após a conclusão da resposta.
-
Devido à latência da resposta, o orçamento pode exceder temporariamente a taxa configurada antes que a fiscalização seja alcançada.
nota
Para solicitações de conclusão de chat de streaming (/v1/chat/completions), o gateway adiciona automaticamente "stream_options": {"include_usage": true} ao corpo da solicitação. Isso acontece quando um limite de taxa de token está ativo e a opção ainda não está presente. Ele garante que contagens precisas de tokens estejam disponíveis na resposta transmitida para aplicação do TPM.
Limites de taxa de conexão
Os limites da taxa de conexão controlam o número de solicitações simultâneas em voo permitidas a qualquer momento. Cada solicitação ocupa um slot de conexão desde a aceitação até a conclusão da resposta. Se uma nova solicitação chegar e o número de conexões ativas atingir o limite configurado, a solicitação será rejeitada com uma resposta HTTP 429.
-
Períodos suportados:
second -
Tipos de alvos suportados: Todos os tipos de alvos (MCP, HTTP, Inferência)
-
Medição: Máximo de solicitações simultâneas em voo
Restrições métricas
| Métrica | Períodos suportados | Alvos compatíveis |
|---|---|---|
|
|
|
Todos |
|
|
|
Somente alvos de inferência (conector, provedor com caminhos conhecidos) |
|
|
|
Todos |
Métricas combinadas
Uma única entrada de limite de taxa pode especificar várias métricas. Quando uma entrada tem várias métricas, todas as métricas são avaliadas de forma independente — a solicitação é limitada se uma única métrica exceder seu limite.
O exemplo a seguir mostra um limite de taxa que impõe solicitações por minuto e tokens por minuto:
{ "rateLimitId": "inference-rps-and-tpm", "dimensionKeys": ["targetName", "$.context.jwt.sub"], "entries": [ { "dimensions": { "targetName": "my-inference-target", "$.context.jwt.sub": "*" }, "requests": [{"rate": 300, "period": "minute"}], "tokens": [{"rate": 50000, "period": "minute"}] } ] }
Neste exemplo, cada chamador é limitado se exceder 300 solicitações por minuto ou 50.000 tokens por minuto atémy-inference-target, qualquer limite atingido primeiro.