Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Mesures relatives aux limites de débit
Les entrées de limite de débit spécifient une ou plusieurs mesures qui définissent ce qui est mesuré et la fenêtre temporelle d'application. Chaque type de métrique a des contraintes spécifiques sur les périodes prises en charge et les types de cibles.
Limites de taux de demande
Les limites de débit de demandes contrôlent le nombre de demandes d'API autorisées au cours d'une période donnée.
-
Périodes prises en charge :
second,minute -
Types de cibles pris en charge : Tous les types de cibles
-
Réglage du taux sur 0 : bloque toutes les demandes correspondantes une fois la propagation terminée (jusqu'à 30 secondes)
Les limites de débit de demandes sont évaluées de manière synchrone avant que la demande ne soit transmise à la cible.
Limites de débit des jetons
Les limites de débit de jetons contrôlent le nombre de jetons (entrée + sortie) consommés au cours d'une fenêtre temporelle. Les limites de débit des jetons s'appliquent uniquement aux cibles d'inférence.
-
Périodes prises en charge :
minute -
Types de cibles pris en charge : cibles d'inférence uniquement (cibles de connecteur et cibles de fournisseur avec des chemins d'inférence connus)
-
Chemins d'inférence connus :
/v1/chat/completions,,/v1/messages/v1/responses
Les limites de taux symboliques sont appliquées en fonction du budget :
-
La passerelle estime l'utilisation des jetons d'entrée avant de transmettre la demande.
-
Le nombre réel de jetons (entrée + sortie) est enregistré une fois la réponse terminée.
-
En raison de la latence de réponse, le budget peut temporairement dépasser le taux configuré avant que l'application ne rattrape son retard.
Note
Pour les demandes de complétion de chat en streaming (/v1/chat/completions), la passerelle ajoute automatiquement "stream_options": {"include_usage": true} au corps de la demande. Cela se produit lorsqu'une limite de débit de jetons est active et que l'option n'est pas déjà présente. Il garantit la disponibilité d'un nombre précis de jetons dans la réponse diffusée pour l'application du TPM.
Limites de débit de connexion
Les limites de débit de connexion contrôlent le nombre de demandes simultanées en vol autorisées à un moment donné. Chaque demande occupe un créneau de connexion entre l'acceptation et la fin de la réponse. Si une nouvelle demande arrive et que le nombre de connexions actives a atteint la limite configurée, la demande est rejetée avec une réponse HTTP 429.
-
Périodes prises en charge :
second -
Types de cibles pris en charge : tous les types de cibles (MCP, HTTP, inférence)
-
Mesure : nombre maximal de demandes simultanées en vol
Contraintes métriques
| Métrique | Périodes prises en charge | Cibles prises en charge |
|---|---|---|
|
|
|
Tous |
|
|
|
Cibles d'inférence uniquement (connecteur, fournisseur avec des chemins connus) |
|
|
|
Tous |
Métriques combinées
Une seule entrée de limite de débit peut spécifier plusieurs mesures. Lorsqu'une entrée comporte plusieurs métriques, toutes les métriques sont évaluées indépendamment : la demande est limitée si une métrique dépasse sa limite.
L'exemple suivant montre une limite de débit qui applique à la fois les demandes par minute et les jetons par minute :
{ "rateLimitId": "inference-rps-and-tpm", "dimensionKeys": ["targetName", "$.context.jwt.sub"], "entries": [ { "dimensions": { "targetName": "my-inference-target", "$.context.jwt.sub": "*" }, "requests": [{"rate": 300, "period": "minute"}], "tokens": [{"rate": 50000, "period": "minute"}] } ] }
Dans cet exemple, chaque appelant est limité s'il dépasse 300 demandes par minute ou 50 000 jetons par minutemy-inference-target, selon la première limite atteinte.