View a markdown version of this page

Kapasitas dan Kinerja - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Kapasitas dan Kinerja

Amazon Bedrock menawarkan opsi kapasitas fleksibel agar sesuai dengan kebutuhan beban kerja dan anggaran Anda. Memahami perbedaan antara tingkatan sesuai permintaan (Flex, Prioritas, Standar), tingkat cadangan, pemrosesan batch, dan inferensi lintas wilayah membantu Anda mengoptimalkan kinerja dan biaya.

Opsi Kapasitas

Jenis Kapasitas Kasus Penggunaan Karakteristik Utama
On-Demand: Fleksibel Beban kerja sporadis dan volume rendah
  • Biaya terendah per token

  • Best-effort ketersediaan

  • Mungkin mengalami pelambatan

  • Tidak ada SLA

On-Demand: Standar Beban kerja produksi reguler
  • Biaya dan kinerja yang seimbang

  • Jaminan throughput moderat

  • Standar SLA

  • Pilihan paling umum

On-Demand: Prioritas High-priority, aplikasi sensitif latensi
  • Biaya sesuai permintaan tertinggi

  • Alokasi throughput premium

  • SLA yang ditingkatkan

  • Mengurangi risiko pelambatan

Tingkat Cadangan Beban kerja yang konsisten dan volume tinggi
  • Unit model yang dicadangkan

  • Kapasitas terjamin

  • Komitmen 1 atau 3 bulan

  • Kinerja yang dapat diprediksi

Batch Large-scale, pemrosesan yang tidak peka waktu
  • Penghematan biaya 50% vs sesuai permintaan

  • Jendela pemrosesan 24 jam

  • Ideal untuk inferensi massal

Cross-Region Inferensi Beban kerja yang dapat diproses di luar satu Wilayah
  • Permintaan rute di seluruh Wilayah dalam profil inferensi

  • Menurunkan biaya token untuk beberapa model dengan profil global

  • Menggunakan harga sesuai permintaan

Batasan Ku & ota

On-Demand Batas (berdasarkan tingkat)

Tingkat Rentang RPM Rentang TPM Risiko Pelambatan
Melenturkan 10-100 5 K-50K Tinggi
Standar 100-500 50 K-150K Sedang
Prioritas 500-1000 + 150 K-300K + Rendah
  • Kapasitas burst: Tersedia di semua tingkatan untuk lonjakan pendek

  • Batas lunak: Dapat ditingkatkan melalui permintaan kuota layanan

  • Model-specific: Batas aktual bervariasi menurut model pondasi

Batas Tingkat Cadangan

  • Komitmen minimum: 1 unit model

  • Unit maksimum: Akun dan spesifik wilayah

  • Input/output batas token: Berdasarkan unit yang dibeli

  • Tidak ada pelambatan RPM dalam kapasitas yang dibeli

Batas Pemrosesan Batch

  • Ukuran pekerjaan: Hingga 10.000 catatan per batch

  • Ukuran file: Berkas masukan maksimum 200 MB

  • Waktu pemrosesan: jendela penyelesaian 24 jam

  • Pekerjaan bersamaan: kuota Region-specific

Cross-Region Inferensi

  • Mewarisi batas tingkat sesuai permintaan per wilayah

  • Tidak ada biaya tambahan kuota

  • Perutean otomatis (tidak ada manajemen batas manual)

Memilih Tingkat

Kerangka Keputusan

Skenario Opsi yang Direkomendasikan Mengapa
Development/testing Melenturkan Biaya terendah, dapat diterima untuk non-produksi
Produksi standar Standar Keseimbangan kinerja biaya terbaik
Aplikasi penting yang menghadap pengguna Prioritas Keandalan dan kinerja melebihi biaya
Beban volume tinggi yang stabil Tingkat Cadangan Penghematan 30-50% dengan komitmen
Pemrosesan data massal Batch Diskon 50%, beban kerja yang tidak mendesak
Mission-critical waktu aktif Cross-Region Inferensi Ketersediaan > biaya

Strategi Optimasi

Pilih Tingkat yang Tep On-Demand at

  • Mulai dengan Standar untuk sebagian besar beban kerja

  • Turunkan versi ke Flex untuk lingkungan dev/test

  • Tingkatkan ke Prioritas hanya saat pelambatan berdampak pada pengguna

  • Pantau metrik CloudWatch throttle untuk menginformasikan keputusan

Transisi ke Tingkat Cadangan

  • Ketika beban yang konsisten melebihi 40% dari biaya sesuai permintaan

  • Hitung impas: (Biaya sesuai permintaan bulanan) vs (Komitmen yang dipesan)

  • Gunakan komitmen 1 bulan pada awalnya

  • Tingkat reservasi dapat bekerja bersama dengan tingkat sesuai permintaan apa pun

Gunakan Batch untuk

  • Pembuatan data pelatihan

  • Backlog moderasi konten

  • Pembuatan laporan

  • Saluran pipa pengayaan data

Menggabungkan Pendekatan

  • Tingkat yang dicadangkan untuk lalu lintas dasar

  • Standar sesuai permintaan untuk semburan sedang

  • Prioritas sesuai permintaan untuk periode puncak kritis

  • Batch untuk pemrosesan offline

  • Gunakan Cross-Region inferensi untuk beban kerja yang dapat diproses di luar satu Wilayah.

Pemantauan Biaya

  • Bandingkan biaya tingkat: Flex < Standar < Prioritas

  • Lacak token per permintaan (mengoptimalkan petunjuk)

  • Gunakan CloudWatch metrik untuk penggunaan dan pelambatan

  • Mengatur alarm penagihan untuk lonjakan tak terduga

  • Tinjau penggunaan tingkat yang dipesan setiap bulan

  • Evaluasi peningkatan tingkat hanya ketika pelambatan terjadi