Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Lapisan 2: Set model dan alat pondasi yang disetujui
Ketika organisasi menavigasi tahap awal adopsi AI generatif, mereka dengan cepat menyadari bahwa tidak ada model tunggal yang dapat mengatasi semua kasus penggunaan secara efektif. Model yang berbeda unggul dalam berbagai domain dan tugas, dan perusahaan perlu menyeimbangkan kemampuan, biaya, dan kinerja untuk setiap aplikasi tertentu. Realitas ini mendorong kebutuhan akan pendekatan yang fleksibel, namun terkontrol, untuk akses model pondasi.
Bagian ini berisi topik berikut:
Eksperimen dan kustomisasi model
Amazon Bedrock dirancang untuk membantu Anda bereksperimen dengan berbagai model pondasi, dan mendukung penerapan produksi yang dapat diskalakan. Dengan Pangkalan Pengetahuan Amazon Bedrock, Anda memiliki solusi yang dikelola sepenuhnya untuk membangun alur kerja end-to-end Retrieval Augmented Generation (RAG). Amazon Bedrock juga mendukung agen terkelola yang dapat menjalankan tugas kompleks tanpa kode, mulai dari pemesanan perjalanan hingga mengelola inventaris. Karena tanpa server, Amazon Bedrock mengurangi masalah manajemen infrastruktur dan terintegrasi dengan aman dengan yang lain. Layanan AWS
Selain itu, Anda dapat menggunakan Amazon Bedrock untuk menyesuaikan model foundation secara pribadi dengan data milik Anda sendiri dan membuatnya tersedia dengan aman bagi pengguna dalam organisasi Anda. Untuk informasi selengkapnya, lihat Menyesuaikan model Anda untuk meningkatkan kinerjanya untuk kasus penggunaan Anda di dokumentasi Amazon Bedrock. Untuk manajemen akses, AWS Identity and Access Management (IAM) terintegrasi dengan Amazon Bedrock sehingga Anda dapat mengonfigurasi kontrol akses berbutir halus. Kontrol menentukan pengguna mana yang dapat mengaktifkan dan mengakses model tertentu. Untuk informasi selengkapnya, lihat Lapisan 3: Keamanan dan tata kelola untuk platform AI generatif AWS dalam panduan ini.
Evaluasi model
Saat organisasi Anda berkembang dari prototipe AI generatif ke produksi, penting untuk menetapkan proses evaluasi yang ketat untuk model pondasi. Meskipun tolok ukur terbuka menawarkan wawasan umum tentang kinerja model, mereka sering gagal ketika menentukan kesesuaian model untuk kebutuhan perusahaan tertentu. Strategi evaluasi yang disesuaikan membantu pengguna memilih model yang paling tepat yang sesuai dengan persyaratan unik organisasi Anda.
Tujuan evaluasi model khusus
Pendekatan evaluasi khusus membantu organisasi melakukan hal berikut:
-
Menilai kinerja pada tugas yang relevan dengan bisnis — Evaluasi seberapa baik model menangani tugas yang terkait langsung dengan kasus penggunaan perusahaan Anda.
-
Identifikasi potensi bias dan keterbatasan — Deteksi area di mana model mungkin menunjukkan bias atau gagal sehingga Anda dapat memastikan model tersebut cocok untuk penerapan dunia nyata.
-
Bandingkan model dengan metrik yang relevan — Bandingkan model yang berbeda dengan menggunakan metrik yang menyelaraskan prioritas dan tujuan organisasi Anda.
-
Buat pemilihan model yang terinformasi — Buat keputusan berbasis data tentang pemilihan model, fine-tuning, dan penerapan ke lingkungan produksi.
Memilih metrik evaluasi model
Evaluasi model yang efektif mengacu pada campuran teknik yang memberikan pandangan holistik tentang kinerja model. Dengan teknik ini, organisasi dapat menilai tidak hanya akurasi teknis model tetapi juga keselarasannya dengan kebutuhan spesifik perusahaan. Untuk mengevaluasi model, Anda menggabungkan metrik kuantitatif dan kualitatif untuk menentukan kinerja, mengidentifikasi bias, dan memilih model. Organizations harus menggunakan metrik berbasis kebenaran dasar (dengan data referensi) dan metrik fleksibel (tanpa data referensi) untuk mendapatkan pandangan komprehensif tentang kesesuaian model. Dalam AI, ground truth mengacu pada data yang faktual dan ditahan selama pelatihan model sehingga Anda dapat menggunakannya untuk evaluasi model.
Gunakan metrik berbasis kebenaran dasar jika data referensi ada. Metrik ini memberikan penilaian kuantitatif yang konkret. Sementara itu, teknik tanpa kebenaran dasar dapat menawarkan fleksibilitas. Teknik-teknik ini membantu Anda mengevaluasi model pada dimensi seperti keterbacaan dan kelengkapan, bahkan ketika jawaban benar yang telah ditentukan sebelumnya tidak tersedia.
Metrik berdasarkan data kebenaran dasar
Jika data referensi tersedia, metrik berbasis kebenaran dasar dapat memberikan penilaian kuantitatif. Metrik berikut memberikan penilaian kinerja kuantitatif:
-
Skor ROUGE-L — Penggantian berorientasi penarikan untuk evaluasi gisting (ROUGE) untuk urutan umum terpanjang (LCS), juga dikenal sebagai ROUGE-L, mengukur urutan umum terpanjang antara teks yang dihasilkan dan referensi. Metrik menilai koherensi dan konten tumpang tindih.
-
Kesamaan kosinus — Metrik ini mengevaluasi kesamaan semantik antar teks. Ini memberikan wawasan tentang pemahaman kontekstual model.
-
Skor METEOR — Metrik untuk evaluasi terjemahan dengan penilaian urutan eksplisit (METEOR) menggabungkan penyelarasan kata dan pencocokan semantik untuk memberikan penilaian yang seimbang tentang akurasi dan makna konten.
-
Kesamaan biner — Metrik ini memeriksa kecocokan yang tepat, membuatnya sangat berguna untuk tugas-tugas yang membutuhkan output yang tepat, seperti pembuatan perintah.
-
LLM-as-a-judge skor — Metrik ini menggunakan model bahasa besar (LLM) lain untuk menilai kesamaan pada skala yang ditentukan. Ini menawarkan evaluasi kualitas yang bernuansa.
Amazon SageMaker Clarify dan Amazon Bedrock menyertakan fitur untuk membantu Anda mengevaluasi model. Mereka dapat mengotomatiskan pekerjaan evaluasi model sehingga Anda dapat mengukur risiko model dan kualitas respons. Untuk informasi selengkapnya, lihat Mengevaluasi, menjelaskan, dan mendeteksi bias dalam model dan Mengevaluasi kinerja sumber daya Amazon Bedrock.
Metrik tanpa data kebenaran dasar
Ketika data referensi tidak tersedia, atau sebagai pendekatan pelengkap, Anda dapat menggunakan teknik iniLLM-as-a-judge . Ini menggunakan model terpisah untuk mengevaluasi output dari solusi AI generatif berdasarkan dimensi yang penting bagi bisnis. Teknik ini memberikan fleksibilitas untuk menilai berbagai kualitas model. Untuk informasi selengkapnya, lihat Mengevaluasi kinerja model menggunakan LLM lain sebagai juri dalam dokumentasi Amazon Bedrock.
Anda dapat menggunakan metrik terkomputasi untuk mengevaluasi seberapa efektif sistem Retrieval Augmented Generation (RAG) mengambil informasi yang relevan dari sumber data Anda, dan seberapa efektif tanggapan yang dihasilkan dalam menjawab pertanyaan. Hasil evaluasi RAG memungkinkan Anda membandingkan Basis Pengetahuan Amazon Bedrock yang berbeda dan sumber RAG lainnya, dan kemudian memilih Basis Pengetahuan atau sistem RAG terbaik untuk aplikasi Anda. Untuk informasi selengkapnya, lihat Mengevaluasi kinerja sumber RAG dalam dokumentasi Amazon Bedrock.
Teknik evaluasi model dalam praktik
Untuk secara efektif mencocokkan kebutuhan perusahaan dengan kemampuan model, gunakan seperangkat kriteria evaluasi yang kuat untuk mengarahkan proses evaluasi model. Kriteria ini mencakup spektrum prioritas, mulai dari kebenaran dan kelengkapan hingga faktualitas dan penanganan data yang sensitif. Setiap kriteria selaras dengan teknik khusus untuk memberikan wawasan yang dapat ditindaklanjuti. Misalnya, ketika akurasi faktual sangat penting, metrik seperti skor ROUGE-L atau kesamaan kosinus memberikan tolok ukur yang konkret dan dapat diukur. Sebaliknya, gunakan teknik seperti LLM-as-a-judge untuk mengevaluasi keterbacaan dan kesegaran. Teknik-teknik ini menawarkan wawasan kualitatif yang fleksibel yang disesuaikan dengan standar organisasi. Dimensi kunci untuk mengevaluasi model meliputi:
-
Kebenaran — Memvalidasi keakuratan informasi yang diberikan
-
Kelengkapan — Memverifikasi kedalaman dan cakupan tanggapan
-
Keterbacaan - Menilai kejelasan dan kemudahan pemahaman
-
Kesegaran informasi — Memeriksa apakah konten relevan dan terkini
-
Penindasan data sensitif — Memeriksa penanganan informasi rahasia yang tepat
-
Akurasi — Mengukur keselarasan dengan informasi faktual
-
Koherensi — Memeriksa aliran logis dan konsistensi
-
Faktualitas - Memverifikasi kebenaran konten
-
Komprehensif — Menilai ruang lingkup dan ketelitian cakupan
Dengan memasang teknik evaluasi model dalam kriteria yang jelas ini, Anda dapat memeriksa model secara menyeluruh untuk tujuan spesifiknya. Pendekatan terstruktur ini menyelaraskan model dengan tujuan perusahaan, persyaratan kepatuhan, dan harapan pengguna. Ini juga meletakkan dasar yang kuat untuk menerapkan aplikasi AI generatif dalam skala besar di lingkungan produksi.
Rekomendasi implementasi
Untuk menetapkan strategi model pondasi yang efektif, pertimbangkan rekomendasi berikut:
-
Membentuk komite tata kelola model yang memiliki peran, tanggung jawab, dan proses pengambilan keputusan yang jelas.
-
Mengembangkan kriteria evaluasi dan mekanisme penilaian untuk penilaian model pondasi sebelum tersedia untuk digunakan di seluruh organisasi.
-
Ingatlah bahwa model pondasi terbesar belum tentu selalu merupakan model terbaik untuk kasus penggunaan Anda. Mulailah proof-of-concept pengembangan dengan model tingkat atas untuk memvalidasi nilai bisnis, dan kemudian secara sistematis mengevaluasi model yang lebih kecil untuk pengoptimalan biaya.
-
Kembangkan dasbor untuk melacak metrik utama, seperti latensi inferensi, throughput, tingkat kesalahan, dan biaya per inferensi.
-
Memberikan panduan yang jelas kepada tim tentang cara memilih model yang tepat untuk kasus penggunaan mereka, termasuk proses eksperimen dan kriteria evaluasi.