Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Metrik batas tarif
Entri batas tarif menentukan satu atau lebih metrik yang menentukan apa yang diukur dan jendela waktu untuk penegakan. Setiap jenis metrik memiliki batasan spesifik pada periode yang didukung dan tipe target.
Batas tarif permintaan
Batas tarif permintaan mengontrol jumlah permintaan API yang diizinkan dalam jendela waktu.
-
Periode yang didukung:
second,minute -
Jenis target yang didukung: Semua jenis target
-
Menyetel tingkat ke 0: Mem blokir semua permintaan yang cocok setelah propagasi selesai (hingga 30 detik)
Batas tarif permintaan dievaluasi secara sinkron sebelum permintaan diteruskan ke target.
Batas tarif token
Batas tarif token mengontrol jumlah token (input+output) yang dikonsumsi dalam jendela waktu. Batas tarif token hanya berlaku untuk target inferensi.
-
Periode yang didukung:
minute -
Jenis target yang didukung: Hanya target inferensi (target konektor dan target penyedia dengan jalur inferensi yang diketahui)
-
Jalur inferensi yang diketahui:
/v1/chat/completions,,/v1/messages/v1/responses
Batas tarif token menggunakan penegakan berbasis anggaran:
-
Gateway memperkirakan penggunaan token input sebelum meneruskan permintaan.
-
Jumlah token aktual (input + output) dicatat setelah respons selesai.
-
Karena latensi respons, anggaran mungkin untuk sementara melebihi tingkat yang dikonfigurasi sebelum penegakan menyusul.
catatan
Untuk permintaan penyelesaian obrolan streaming (/v1/chat/completions), gateway secara otomatis menambahkan "stream_options": {"include_usage": true} ke badan permintaan. Ini terjadi ketika batas tarif token aktif dan opsi belum ada. Ini memastikan jumlah token yang akurat tersedia dalam respons streaming untuk penegakan TPM.
Batas tingkat koneksi
Batas kecepatan koneksi mengontrol jumlah permintaan dalam penerbangan bersamaan yang diizinkan pada waktu tertentu. Setiap permintaan menempati slot koneksi dari penerimaan hingga respons selesai. Jika permintaan baru tiba dan jumlah koneksi aktif telah mencapai batas yang dikonfigurasi, permintaan ditolak dengan respons HTTP 429.
-
Periode yang didukung:
second -
Jenis target yang didukung: Semua jenis target (MCP, HTTP, Inferensi)
-
Pengukuran: Permintaan dalam penerbangan bersamaan maksimum
Kendala metrik
| Metrik | Periode yang didukung | Target yang didukung |
|---|---|---|
|
|
|
Semua |
|
|
|
Target inferensi saja (konektor, penyedia dengan jalur yang diketahui) |
|
|
|
Semua |
Metrik gabungan
Entri batas tarif tunggal dapat menentukan beberapa metrik. Ketika entri memiliki beberapa metrik, semua metrik dievaluasi secara independen — permintaan akan dibatasi jika ada metrik tunggal yang melebihi batasnya.
Contoh berikut menunjukkan batas tarif yang memberlakukan permintaan per menit dan token per menit:
{ "rateLimitId": "inference-rps-and-tpm", "dimensionKeys": ["targetName", "$.context.jwt.sub"], "entries": [ { "dimensions": { "targetName": "my-inference-target", "$.context.jwt.sub": "*" }, "requests": [{"rate": 300, "period": "minute"}], "tokens": [{"rate": 50000, "period": "minute"}] } ] }
Dalam contoh ini, setiap penelepon dibatasi jika melebihi 300 permintaan per menit atau 50.000 token per menitmy-inference-target, batas mana pun yang dicapai lebih dulu.