翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
レート制限メトリクス
レート制限エントリは、測定対象と適用の時間枠を定義する 1 つ以上のメトリクスを指定します。各メトリクスタイプには、サポートされている期間とターゲットタイプに特定の制約があります。
リクエストレート制限
リクエストレート制限は、時間枠内で許可される API リクエストの数を制御します。
-
サポートされている期間:
second、minute -
サポートされているターゲットタイプ: すべてのターゲットタイプ
-
レートを 0 に設定する: 伝播が完了すると (最大 30 秒)、一致するすべてのリクエストをブロックします
リクエストレート制限は、リクエストがターゲットに転送される前に同期的に評価されます。
トークンレート制限
トークンレート制限は、時間枠内で消費されるトークンの数 (入力 + 出力) を制御します。トークンレート制限は推論ターゲットにのみ適用されます。
-
サポートされている期間:
minute -
サポートされているターゲットタイプ: 推論ターゲットのみ (既知の推論パスを持つコネクタターゲットとプロバイダーターゲット)
-
既知の推論パス:
/v1/chat/completions、/v1/messages、/v1/responses
トークンレート制限では、予算ベースの適用を使用します。
-
ゲートウェイは、リクエストを転送する前に入力トークンの使用状況を推定します。
-
実際のトークン数 (入力 + 出力) は、レスポンスの完了後に記録されます。
-
レスポンスのレイテンシーにより、予算は強制が追いつく前に一時的に設定されたレートを超える可能性があります。
注記
ストリーミングチャット完了リクエスト (/v1/chat/completions) の場合、ゲートウェイは"stream_options": {"include_usage": true}リクエスト本文に自動的に を追加します。これは、トークンレート制限がアクティブで、 オプションがまだ存在しない場合に発生します。これにより、TPM 適用のストリーミングレスポンスで正確なトークン数が利用可能になります。
接続レートの制限
接続レート制限は、任意の時点で許可される同時処理中のリクエストの数を制御します。各リクエストは、応答が完了するまでの承諾から接続スロットを占有します。新しいリクエストが到着し、アクティブな接続の数が設定された制限に達すると、リクエストは HTTP 429 レスポンスで拒否されます。
-
サポートされている期間:
second -
サポートされているターゲットタイプ: すべてのターゲットタイプ (MCP、HTTP、推論)
-
測定: 同時処理中のリクエストの最大数
メトリクスの制約
| メトリクス | サポートされている期間 | サポートされているターゲット |
|---|---|---|
|
|
|
すべて |
|
|
|
推論ターゲットのみ (コネクタ、既知のパスを持つプロバイダー) |
|
|
|
すべて |
結合メトリクス
1 つのレート制限エントリで複数のメトリクスを指定できます。エントリに複数のメトリクスがある場合、すべてのメトリクスが個別に評価されます。1 つのメトリクスが制限を超えると、リクエストはスロットリングされます。
次の例は、1 分あたりのリクエスト数と 1 分あたりのトークン数の両方を強制するレート制限を示しています。
{ "rateLimitId": "inference-rps-and-tpm", "dimensionKeys": ["targetName", "$.context.jwt.sub"], "entries": [ { "dimensions": { "targetName": "my-inference-target", "$.context.jwt.sub": "*" }, "requests": [{"rate": 300, "period": "minute"}], "tokens": [{"rate": 50000, "period": "minute"}] } ] }
この例では、各発信者が 1 分あたり 300 リクエスト、または 1 分あたり 50,000 トークンのいずれかの上限に達した場合にmy-inference-target、各発信者がスロットリングされます。