Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Kuota untuk titik akhir mantel dasar
bedrock-mantle.Endpoint melayani OpenAI Responses API, OpenAI Chat Completions API, dan Anthropic Messages API. Lalu lintas inferensi ke titik akhir ini diatur oleh serangkaian kuota terpisah dari titik akhir. region.api.awsbedrock-runtime
Anda dapat melihat bedrock-mantle kuota di konsol Service Quotas dengan memilih Amazon Bedrock sebagai layanan dan mencari Bedrock Mantle. Untuk meminta kenaikan kuota ini, lihatMeminta peningkatan kuota.
Jenis kuota
Inferensi pada bedrock-mantle titik akhir diatur oleh dua kuota per model:
| Kuota | Lingkup | Deskripsi |
|---|---|---|
Token masukan Bedrock Mantle per menit untuk ${model} |
Per model, per Wilayah | Jumlah maksimum token input per menit yang dapat dikirimkan akun Anda ke model pada bedrock-mantle titik akhir. Dibagikan di semua API yang dilayani oleh titik akhir untuk model itu. |
Token keluaran Bedrock Mantle per menit untuk ${model} |
Per model, per Wilayah | Jumlah maksimum token keluaran per menit yang dapat dihasilkan model untuk akun Anda di bedrock-mantle titik akhir. Dibagikan di semua API yang dilayani oleh titik akhir untuk model itu. |
catatan
Token input cache yang dibaca melalui caching prompt tidak dihitung terhadap kuota input-tokens-per-menit.
catatan
bedrock-mantleTitik akhir tidak memberlakukan kuota requests-per-minute (RPM). Throttling diatur hanya oleh kuota token input dan output yang dijelaskan di bagian ini.
Bagaimana permintaan dievaluasi terhadap kuota
Saat Anda mengirimkan permintaan inferensi ke bedrock-mantle titik akhir, AWS evaluasi terhadap kuota Anda dalam urutan sebagai berikut:
-
Token input per menit — Jumlah token input dalam permintaan, ditambah nilai
max_tokens(atau maksimum spesifik model jika tidak disetel), diperiksa terhadapmax_tokenskuota input-tokens-per-menit untuk model yang diminta. Jika mengakui permintaan akan melebihi kuota, permintaan dibatasi dengan respons HTTP 429. -
Token keluaran per menit — Saat model mengalirkan atau menghasilkan output, token keluaran dihitung terhadap kuota output-tokens-per-menit untuk model itu. Jika kuota tercapai selama pembuatan, generasi berhenti dan respons dikembalikan dengan alasan akhir yang menunjukkan batas.
Setelah respons selesai, setiap bagian yang tidak terpakai dari reservasi input-token awal (perbedaan antara max_tokens dan output aktual) diisi ulang ke kuota Anda.
Titik akhir dapat menerapkan pembatasan tarif internal tambahan yang tidak diekspos dalam Service Quotas. Gunakan logika coba lagi dengan backoff eksponensial untuk menangani pelambatan sementara.
Kuota TPM bedrock-runtime titik akhir menghitung token input dan output bersama-sama terhadap kuota per-model tunggal, sedangkan bedrock-mantle titik akhir menerapkan kuota input-tokens-per-menit dan output-tokens-per-menit yang terpisah. Jika Anda menjalankan beban kerja di kedua titik akhir, rencanakan kapasitas untuk setiap titik akhir secara independen. Untuk detail tentang kuota titik akhir runtime, lihat. Kuota untuk endpoint batuan dasar runtime
Nilai kuota default
Tabel berikut mencantumkan kuota default untuk model pada titik bedrock-mantle akhir. Baru Akun AWS mungkin menerima kuota yang dikurangi, dan kuota dapat bervariasi menurut Wilayah.
| Model | Masukan standar TPM | Output standar TPM |
|---|---|---|
| AnthropicClaude Opus 4.7 | 20.000.000 | 4.000.000 |
Model tambahan akan tercantum dalam tabel ini saat diluncurkan di titik akhir.
Model tanpa kuota TPM yang diterbitkan
bedrock-mantleTitik akhir memberlakukan kuota TPM yang diterbitkan hanya untuk model yang tercantum dalam tabel di atas. Model lain yang disajikan pada titik akhir ini tidak memiliki kuota TPM per akun yang diekspos dalam Service Quotas hari ini — throughputnya diatur oleh kapasitas layanan internal. AWS mungkin memperkenalkan kuota per akun untuk model tambahan sebagai skala penggunaan. Gunakan logika coba lagi dengan backoff eksponensial untuk menangani pelambatan sementara. Jika Anda memerlukan kuota yang dipublikasikan untuk model tertentu, hubungi AWS Support.
Wilayah yang Didukung
bedrock-mantlekuota terlihat di Service Quotas di Wilayah AWS yang sama di mana titik bedrock-mantle akhir tersedia. Untuk daftar lengkap Wilayah dan URL titik akhir, lihat. Wilayah dan Titik Akhir yang Didukung
Meminta peningkatan kuota
bedrock-mantleKuota terlihat di Service Quotas, tetapi permintaan peningkatan kuota saat ini tidak diproses melalui konsol Service Quotas. Untuk meminta peningkatan, kirimkan permintaan melalui formulir peningkatan batas AWS Dukungan
-
Titik akhir (
bedrock-mantle). -
Wilayah .
-
Model.
-
Nama kuota (input TPM atau output TPM) dan nilai yang Anda minta.
Anda dapat meminta peningkatan ke input-tokens-per-menit dan output-tokens-per-menit untuk model yang sama dalam satu kasus dukungan. Persetujuan tergantung pada apakah penggunaan Anda yang ada membenarkan peningkatan tersebut, jadi sertakan informasi penggunaan terbaru dari CloudWatch atau konsol Service Quotas dengan permintaan Anda.
Perbedaan dari kuota bedrock-runtime
bedrock-mantleKuota independen dari bedrock-runtime kuota. Lalu lintas ke bedrock-runtime. dan lalu lintas untuk region.amazonaws.com.rproxy.govskope.cabedrock-mantle. menggunakan alokasi kuota terpisah, bahkan ketika memanggil model dasar yang sama.region.api.aws
Kuota profil inferensi kustom, kuota inferensi batch, dan alokasi Throughput yang Disediakan hanya berlaku untuk titik akhir dan tidak diekspos pada titik bedrock-runtime akhir. bedrock-mantle