View a markdown version of this page

Kuota untuk titik akhir mantel dasar - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Kuota untuk titik akhir mantel dasar

bedrock-mantle.region.api.awsEndpoint melayani OpenAI Responses API, OpenAI Chat Completions API, dan Anthropic Messages API. Lalu lintas inferensi ke titik akhir ini diatur oleh serangkaian kuota terpisah dari titik akhir. bedrock-runtime

Anda dapat melihat bedrock-mantle kuota di konsol Service Quotas dengan memilih Amazon Bedrock sebagai layanan dan mencari Bedrock Mantle. Untuk meminta kenaikan kuota ini, lihatMeminta peningkatan kuota.

Jenis kuota

Inferensi pada bedrock-mantle titik akhir diatur oleh dua kuota per model:

kuota mantel batuan dasar per model
Kuota Lingkup Deskripsi
Token masukan Bedrock Mantle per menit untuk ${model} Per model, per Wilayah Jumlah maksimum token input per menit yang dapat dikirimkan akun Anda ke model pada bedrock-mantle titik akhir. Dibagikan di semua API yang dilayani oleh titik akhir untuk model itu.
Token keluaran Bedrock Mantle per menit untuk ${model} Per model, per Wilayah Jumlah maksimum token keluaran per menit yang dapat dihasilkan model untuk akun Anda di bedrock-mantle titik akhir. Dibagikan di semua API yang dilayani oleh titik akhir untuk model itu.
catatan

Token input cache yang dibaca melalui caching prompt tidak dihitung terhadap kuota input-tokens-per-menit.

catatan

bedrock-mantleTitik akhir tidak memberlakukan kuota requests-per-minute (RPM). Throttling diatur hanya oleh kuota token input dan output yang dijelaskan di bagian ini.

Bagaimana permintaan dievaluasi terhadap kuota

Saat Anda mengirimkan permintaan inferensi ke bedrock-mantle titik akhir, AWS evaluasi terhadap kuota Anda dalam urutan sebagai berikut:

  1. Token input per menit — Jumlah token input dalam permintaan, ditambah nilai max_tokens (atau maksimum spesifik model jika tidak disetel), diperiksa terhadap max_tokens kuota input-tokens-per-menit untuk model yang diminta. Jika mengakui permintaan akan melebihi kuota, permintaan dibatasi dengan respons HTTP 429.

  2. Token keluaran per menit — Saat model mengalirkan atau menghasilkan output, token keluaran dihitung terhadap kuota output-tokens-per-menit untuk model itu. Jika kuota tercapai selama pembuatan, generasi berhenti dan respons dikembalikan dengan alasan akhir yang menunjukkan batas.

Setelah respons selesai, setiap bagian yang tidak terpakai dari reservasi input-token awal (perbedaan antara max_tokens dan output aktual) diisi ulang ke kuota Anda.

Titik akhir dapat menerapkan pembatasan tarif internal tambahan yang tidak diekspos dalam Service Quotas. Gunakan logika coba lagi dengan backoff eksponensial untuk menangani pelambatan sementara.

Kuota TPM bedrock-runtime titik akhir menghitung token input dan output bersama-sama terhadap kuota per-model tunggal, sedangkan bedrock-mantle titik akhir menerapkan kuota input-tokens-per-menit dan output-tokens-per-menit yang terpisah. Jika Anda menjalankan beban kerja di kedua titik akhir, rencanakan kapasitas untuk setiap titik akhir secara independen. Untuk detail tentang kuota titik akhir runtime, lihat. Kuota untuk endpoint batuan dasar runtime

Nilai kuota default

Tabel berikut mencantumkan kuota default untuk model pada titik bedrock-mantle akhir. Baru Akun AWS mungkin menerima kuota yang dikurangi, dan kuota dapat bervariasi menurut Wilayah.

Kuota mantel dasar standar berdasarkan model
Model Masukan standar TPM Output standar TPM
AnthropicClaude Opus 4.7 20.000.000 4.000.000

Model tambahan akan tercantum dalam tabel ini saat diluncurkan di titik akhir.

Model tanpa kuota TPM yang diterbitkan

bedrock-mantleTitik akhir memberlakukan kuota TPM yang diterbitkan hanya untuk model yang tercantum dalam tabel di atas. Model lain yang disajikan pada titik akhir ini tidak memiliki kuota TPM per akun yang diekspos dalam Service Quotas hari ini — throughputnya diatur oleh kapasitas layanan internal. AWS mungkin memperkenalkan kuota per akun untuk model tambahan sebagai skala penggunaan. Gunakan logika coba lagi dengan backoff eksponensial untuk menangani pelambatan sementara. Jika Anda memerlukan kuota yang dipublikasikan untuk model tertentu, hubungi AWS Support.

Wilayah yang Didukung

bedrock-mantlekuota terlihat di Service Quotas di Wilayah AWS yang sama di mana titik bedrock-mantle akhir tersedia. Untuk daftar lengkap Wilayah dan URL titik akhir, lihat. Wilayah dan Titik Akhir yang Didukung

Meminta peningkatan kuota

bedrock-mantleKuota terlihat di Service Quotas, tetapi permintaan peningkatan kuota saat ini tidak diproses melalui konsol Service Quotas. Untuk meminta peningkatan, kirimkan permintaan melalui formulir peningkatan batas AWS Dukungan dan pilih Amazon Bedrock sebagai layanan. Dalam permintaan Anda, tentukan:

  • Titik akhir (bedrock-mantle).

  • Wilayah .

  • Model.

  • Nama kuota (input TPM atau output TPM) dan nilai yang Anda minta.

Anda dapat meminta peningkatan ke input-tokens-per-menit dan output-tokens-per-menit untuk model yang sama dalam satu kasus dukungan. Persetujuan tergantung pada apakah penggunaan Anda yang ada membenarkan peningkatan tersebut, jadi sertakan informasi penggunaan terbaru dari CloudWatch atau konsol Service Quotas dengan permintaan Anda.

Perbedaan dari kuota bedrock-runtime

bedrock-mantleKuota independen dari bedrock-runtime kuota. Lalu lintas ke bedrock-runtime.region.amazonaws.com dan lalu lintas untuk bedrock-mantle.region.api.aws menggunakan alokasi kuota terpisah, bahkan ketika memanggil model dasar yang sama.

Kuota profil inferensi kustom, kuota inferensi batch, dan alokasi Throughput yang Disediakan hanya berlaku untuk titik akhir dan tidak diekspos pada titik bedrock-runtime akhir. bedrock-mantle