Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Kapasitas dan Kinerja
Amazon Bedrock menawarkan opsi kapasitas fleksibel agar sesuai dengan kebutuhan beban kerja dan anggaran Anda. Memahami perbedaan antara tingkatan sesuai permintaan (Flex, Prioritas, Standar), tingkat cadangan, pemrosesan batch, dan inferensi lintas wilayah membantu Anda mengoptimalkan kinerja dan biaya.
Opsi Kapasitas
| Jenis Kapasitas | Kasus Penggunaan | Karakteristik Utama |
|---|---|---|
| On-Demand: Fleksibel | Beban kerja sporadis dan volume rendah |
|
| On-Demand: Standar | Beban kerja produksi reguler |
|
| On-Demand: Prioritas | High-priority, aplikasi sensitif latensi |
|
| Tingkat Cadangan | Beban kerja yang konsisten dan volume tinggi |
|
| Batch | Large-scale, pemrosesan yang tidak peka waktu |
|
| Cross-Region Inferensi | Beban kerja yang dapat diproses di luar satu Wilayah |
|
Batasan Ku & ota
On-Demand Batas (berdasarkan tingkat)
| Tingkat | Rentang RPM | Rentang TPM | Risiko Pelambatan |
|---|---|---|---|
| Melenturkan | 10-100 | 5 K-50K | Tinggi |
| Standar | 100-500 | 50 K-150K | Sedang |
| Prioritas | 500-1000 + | 150 K-300K + | Rendah |
Kapasitas burst: Tersedia di semua tingkatan untuk lonjakan pendek
Batas lunak: Dapat ditingkatkan melalui permintaan kuota layanan
Model-specific: Batas aktual bervariasi menurut model pondasi
Batas Tingkat Cadangan
Komitmen minimum: 1 unit model
Unit maksimum: Akun dan spesifik wilayah
Input/output batas token: Berdasarkan unit yang dibeli
Tidak ada pelambatan RPM dalam kapasitas yang dibeli
Batas Pemrosesan Batch
Ukuran pekerjaan: Hingga 10.000 catatan per batch
Ukuran file: Berkas masukan maksimum 200 MB
Waktu pemrosesan: jendela penyelesaian 24 jam
Pekerjaan bersamaan: kuota Region-specific
Cross-Region Inferensi
Mewarisi batas tingkat sesuai permintaan per wilayah
Tidak ada biaya tambahan kuota
Perutean otomatis (tidak ada manajemen batas manual)
Memilih Tingkat
Kerangka Keputusan
| Skenario | Opsi yang Direkomendasikan | Mengapa |
|---|---|---|
| Development/testing | Melenturkan | Biaya terendah, dapat diterima untuk non-produksi |
| Produksi standar | Standar | Keseimbangan kinerja biaya terbaik |
| Aplikasi penting yang menghadap pengguna | Prioritas | Keandalan dan kinerja melebihi biaya |
| Beban volume tinggi yang stabil | Tingkat Cadangan | Penghematan 30-50% dengan komitmen |
| Pemrosesan data massal | Batch | Diskon 50%, beban kerja yang tidak mendesak |
| Mission-critical waktu aktif | Cross-Region Inferensi | Ketersediaan > biaya |
Strategi Optimasi
Pilih Tingkat yang Tep On-Demand at
Mulai dengan Standar untuk sebagian besar beban kerja
Turunkan versi ke Flex untuk lingkungan dev/test
Tingkatkan ke Prioritas hanya saat pelambatan berdampak pada pengguna
Pantau metrik CloudWatch throttle untuk menginformasikan keputusan
Transisi ke Tingkat Cadangan
Ketika beban yang konsisten melebihi 40% dari biaya sesuai permintaan
Hitung impas: (Biaya sesuai permintaan bulanan) vs (Komitmen yang dipesan)
Gunakan komitmen 1 bulan pada awalnya
Tingkat reservasi dapat bekerja bersama dengan tingkat sesuai permintaan apa pun
Gunakan Batch untuk
Pembuatan data pelatihan
Backlog moderasi konten
Pembuatan laporan
Saluran pipa pengayaan data
Menggabungkan Pendekatan
Tingkat yang dicadangkan untuk lalu lintas dasar
Standar sesuai permintaan untuk semburan sedang
Prioritas sesuai permintaan untuk periode puncak kritis
Batch untuk pemrosesan offline
Gunakan Cross-Region inferensi untuk beban kerja yang dapat diproses di luar satu Wilayah.
Pemantauan Biaya
Bandingkan biaya tingkat: Flex < Standar < Prioritas
Lacak token per permintaan (mengoptimalkan petunjuk)
Gunakan CloudWatch metrik untuk penggunaan dan pelambatan
Mengatur alarm penagihan untuk lonjakan tak terduga
Tinjau penggunaan tingkat yang dipesan setiap bulan
Evaluasi peningkatan tingkat hanya ketika pelambatan terjadi