View a markdown version of this page

Bagaimana token dihitung di Amazon Bedrock - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Bagaimana token dihitung di Amazon Bedrock

Saat Anda menjalankan inferensi model, ada kuota pada jumlah token yang dapat diproses tergantung pada model Amazon Bedrock yang Anda gunakan. Tinjau terminologi berikut terkait dengan kuota token:

Jangka Waktu Definisi
InputTokenCount Metrik runtime CloudWatch Amazon Bedrock yang mewakili jumlah token input yang diproses oleh model, tidak termasuk token yang di-cache. Untuk menentukan total konsumsi token input Anda terhadap kuota Anda, jumlahkanInputTokenCount + CacheWriteInputTokens.
OutputTokenCount Metrik runtime CloudWatch Amazon Bedrock yang mewakili jumlah token yang dihasilkan oleh model sebagai respons terhadap permintaan.
CacheReadInputTokens Metrik runtime CloudWatch Amazon Bedrock yang mewakili jumlah token input yang berhasil diambil dari cache alih-alih diproses ulang oleh model. Nilai ini adalah 0 jika Anda tidak menggunakan cache Caching cepat untuk inferensi model yang lebih cepat prompt.
CacheWriteInputTokens Metrik runtime CloudWatch Amazon Bedrock yang mewakili jumlah token input yang berhasil ditulis ke dalam cache. Nilai ini adalah 0 jika Anda tidak menggunakan cache Caching cepat untuk inferensi model yang lebih cepat prompt.
Token per menit (TPM) Kuota yang AWS ditetapkan pada tingkat model pada jumlah token (termasuk input dan output) yang dapat Anda gunakan dalam satu menit.
Token per hari (TPD) Kuota yang AWS ditetapkan pada tingkat model pada jumlah token (termasuk input dan output) yang dapat Anda gunakan dalam satu hari. Secara default, nilai ini adalah TPM x 24 x 60. Namun, baru Akun AWS telah mengurangi kuota.
max_tokens Parameter yang Anda berikan dalam permintaan Anda untuk menetapkan jumlah maksimum token keluaran yang dapat dihasilkan model.
Tingkat pembakaran Tingkat di mana token input dan output diubah menjadi penggunaan kuota token untuk sistem throttling.

Tingkat pembakaran untuk model Anthropic Claude versi 4.8 adalah 15x untuk token keluaran (1 token keluaran mengkonsumsi 15 token dari kuota Anda) dan tingkat pembakaran untuk Anthropic Claude Sonnet 5 adalah 10x untuk token keluaran. Tingkat pembakaran untuk Anthropic Claude Opus 5 adalah 10x untuk token keluaran. Untuk semua model Anthropic lainnya versi 4.7 dan di bawahnya, pembakaran adalah 5x untuk token keluaran (1 token keluaran mengkonsumsi 5 token dari kuota Anda).

Untuk semua model lainnya, tingkat pembakaran adalah 1:1 (1 token keluaran mengkonsumsi 1 token dari kuota Anda).

Tarif pembakaran token hanya berlaku untuk model yang tersedia di bedrock-runtime titik akhir. Model yang tersedia secara eksklusif di bedrock-mantle titik akhir memiliki kuota terpisah untuk token input dan output, jadi burndown tidak berlaku.

Memahami manajemen kuota token

Saat Anda membuat permintaan, token dikurangkan dari kuota TPM dan TPD Anda. Perhitungan terjadi pada tahapan berikut:

  • Pada awal permintaan — Jumlah berikut dikurangkan dari kuota Anda. Permintaan akan dibatasi jika Anda melebihi kuota.

    Total input tokens + max_tokens
  • Selama pemrosesan — Kuota yang dikonsumsi oleh permintaan disesuaikan secara berkala untuk memperhitungkan jumlah aktual token keluaran yang dihasilkan.

  • Di akhir permintaan — Jumlah total token yang dikonsumsi oleh permintaan akan dihitung sebagai berikut dan token yang tidak digunakan diisi ulang ke kuota Anda:

    InputTokenCount + CacheWriteInputTokens + (OutputTokenCount x burndown rate)

    CacheReadInputTokensjangan berkontribusi pada perhitungan ini dan tidak dihitung dalam kuota Anda. Jika Anda tidak menggunakan cache prompt, keduanya CacheWriteInputTokens CacheReadInputTokens akan menjadi 0.

catatan

Anda hanya ditagih untuk penggunaan token Anda yang sebenarnya.

Misalnya, jika Anda menggunakan Anthropic Claude Sonnet 4 dan mengirim permintaan yang berisi 1.000 token input dan menghasilkan respons yang setara dengan 100 token:

  • 1.500 token (1.000 + 100 x 5) akan habis dari kuota TPM dan TPD Anda.

  • Anda hanya akan ditagih untuk 1.100 token.

Memahami dampak parameter max_tokens

max_tokensNilai dikurangkan dari kuota Anda di awal setiap permintaan. Jika Anda mencapai kuota TPM lebih awal dari yang diharapkan, coba kurangi max_tokens untuk memperkirakan ukuran penyelesaian Anda dengan lebih baik.

Skenario berikut memberikan contoh bagaimana pengurangan kuota akan bekerja pada permintaan yang diselesaikan menggunakan model yang memiliki tingkat pembakaran 5x untuk token keluaran::

Asumsikan parameter berikut:

  • InputTokenCount: 3.000

  • CacheReadInputTokens: 4,000

  • CacheWriteInputTokens: 1.000

  • OutputTokenCount: 1.000

  • max_token: 32.000

Pengurangan kuota berikut terjadi:

  • Pengurangan awal saat permintaan dibuat: 36.000 (= 3.000 + 1.000 + 32.000)

  • Pengurangan akhir yang disesuaikan setelah respons dihasilkan: 9.000 (= 3.000 + 1.000 + 1.000 x 5)

Dalam skenario ini, lebih sedikit permintaan bersamaan yang dapat dibuat karena max_tokens parameter diatur terlalu tinggi. Ini mengurangi konkurensi permintaan, throughput, dan penggunaan kuota, karena kapasitas kuota TPM akan tercapai dengan cepat.

Asumsikan parameter berikut:

  • InputTokenCount: 3.000

  • CacheReadInputTokens: 4,000

  • CacheWriteInputTokens: 1.000

  • OutputTokenCount: 1.000

  • max_token: 1.250

Pengurangan kuota berikut terjadi:

  • Pengurangan awal saat permintaan dibuat: 5.250 (= 3.000 + 1.000 + 1.250)

  • Pengurangan akhir yang disesuaikan setelah respons dihasilkan: 9.000 (= 3.000 + 1.000 + 1.000 x 5)

Dalam skenario ini, max_tokens parameter dioptimalkan, karena pengurangan awal hanya sedikit lebih tinggi dari pengurangan akhir yang disesuaikan. Ini membantu meningkatkan konkurensi permintaan, throughput, dan penggunaan kuota.

Mengoptimalkan parameter max_tokens

Dengan mengoptimalkan max_tokens parameter, Anda dapat menggunakan kapasitas kuota yang dialokasikan secara efisien. Untuk membantu menginformasikan keputusan Anda tentang parameter ini, Anda dapat menggunakan Amazon CloudWatch, yang secara otomatis mengumpulkan metrik dari AWS layanan, termasuk data penggunaan token di Amazon Bedrock.

Token dicatat dalam metrik InputTokenCount dan OutputTokenCount runtime (untuk metrik lainnya, lihatMetrik runtime Amazon Bedrock.

Untuk menggunakan CloudWatch pemantauan untuk menginformasikan keputusan Anda tentang max_tokens parameter, lakukan hal berikut di Konsol Manajemen AWS:

  1. Masuk ke CloudWatch konsol Amazon di https://console.aws.amazon.com/cloudwatch.

  2. Dari panel navigasi kiri, pilih Dasbor.

  3. Pilih tab Dasbor otomatis.

  4. Pilih Bedrock.

  5. Di dasbor Token Counts by Model, pilih ikon perluas.

  6. Pilih parameter durasi waktu dan rentang untuk metrik untuk memperhitungkan penggunaan puncak.

  7. Dari menu dropdown berlabel Sum, Anda dapat memilih metrik yang berbeda untuk mengamati penggunaan token Anda. Periksa metrik ini untuk memandu keputusan Anda dalam menetapkan max_tokens nilai Anda.