Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Profil inferensi aplikasi
Profil inferensi aplikasi (AIP) memungkinkan Anda mengaitkan biaya Amazon Bedrock berdasarkan aplikasi, tim, atau beban kerja untuk API Amazon Bedrock InvokeModel dan Converse di titik akhir. bedrock-runtime Setiap AIP khusus model dan membawa tag alokasi biaya yang mengalir ke Cost Explorer dan AWS Laporan AWS Biaya dan Penggunaan (baik CUR klasik dan CUR 2.0).
Untuk beban kerja yang menggunakan Tanggapan dan Penyelesaian Obrolan di titik bedrock-mantle akhir, gunakan sebagai gantinya. Proyek
penting
Profil inferensi aplikasi tidak didukung oleh API Tanggapan dan Penyelesaian Obrolan, di salah satu titik akhir. Permintaan ke API yang menamai profil inferensi aplikasi sebagai target inferensi ditolak dengan kesalahan 400. Gunakan AIP dengan API InvokeModel dan Converse, dan atribut penggunaan Respons dan Penyelesaian Obrolan dengan atau sebagai gantinya. Atribusi utama IAM Per-request penandaan metadata Profil inferensi sistem, geografis, dan global bekerja secara normal dengan semua API ini.
Cara kerja atribusi biaya
Profil inferensi aplikasi adalah sumber daya yang mereferensikan model Amazon Bedrock tertentu. Anda membuat profil, melampirkan tag alokasi biaya, dan kemudian menggunakan profil ARN sebagai pengganti ID model dalam panggilan API Anda. Tag profil dilampirkan ke catatan penagihan untuk setiap permintaan.
Contoh berikut menunjukkan cara menggunakan profil inferensi aplikasi ARN alih-alih ID model saat memanggil API Converse:
import boto3 client = boto3.client("bedrock-runtime") response = client.converse( modelId="arn:aws:bedrock:us-east-1:123456789012:inference-profile/my-team-profile", messages=[ {"role": "user", "content": [{"text": "Hello"}]} ] )
Untuk informasi selengkapnya tentang membuat profil, lihatBuat profil inferensi aplikasi.
catatan
Profil inferensi aplikasi mengirimkan dolar tagihan agregat ke AWS Cost Explorer dan CUR (CUR klasik dan CUR 2.0). Biji-bijian terbaik adalah per jenis penggunaan per hari; mereka tidak menghasilkan biaya per permintaan. Untuk detail token per prompt, gunakan Per-request penandaan metadata dengan log pemang gilan model Anda.
Melihat biaya profil
Setelah membuat dan menandai profil Anda, aktifkan tag sebagai tag alokasi biaya di konsol Pen AWS agihan dan Manajemen Biaya:
-
Buka konsol Pen AWS agihan dan Manajemen Biaya.
-
Di panel navigasi, pilih Tag alokasi biaya.
-
Pilih tag yang Anda terapkan ke profil Anda.
-
Pilih Aktifkan.
Tag dapat memakan waktu hingga 24 jam untuk muncul di Cost Explorer dan CUR setelah aktivasi. Tag alokasi biaya tidak berlaku surut. Hanya biaya yang dikeluarkan setelah aktivasi yang ditandai. Untuk informasi selengkapnya, lihat Meng aktifkan tag alokasi biaya yang ditentukan pengguna.
Setelah aktivasi tag, Anda dapat menganalisis biaya Amazon Bedrock berdasarkan profil inferensi aplikasi di alat berikut:
-
AWS Penjelajah Biaya - Filter berdasarkan tag profil untuk melihat tren biaya dari waktu ke waktu. Kelompokkan berdasarkan tag untuk membandingkan biaya di seluruh profil.
-
AWS Laporan Biaya dan Penggunaan — Kueri data CUR untuk rincian biaya item baris berdasarkan tag profil. Tag muncul di ekspor CUR dan CUR 2.0 klasik.
Pertimbangan penskalaan
Setiap profil inferensi aplikasi terkait dengan model tertentu. Ini berarti Anda memerlukan profil terpisah untuk setiap kombinasi unik model, tim, dan set tag. Seiring pertumbuhan organisasi, jumlah profil dapat meningkat dengan cepat, terutama ketika versi model baru memerlukan profil baru.
Untuk mengurangi proliferasi profil:
-
Direkomendasikan: Gunakan Proyek untuk fleksibilitas dan kemudahan saat pelacakan biaya.
-
Tandai di tingkat tim atau pusat biaya, bukan per pengguna.
-
Untuk atribusi biaya per pengguna tanpa membuat profil tambahan, gunakan. Atribusi utama IAM Pelacakan utama IAM bekerja bersama profil inferensi aplikasi dan biaya atribut pada tingkat identitas secara otomatis.
-
Untuk detail token per prompt daripada dolar agregat, gunakan Per-request penandaan metadata dengan log pemanggilan model Anda. Tidak memerlukan sumber daya per model.