Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Evaluator
Evaluator adalah komponen inti yang menilai kinerja agen Anda di berbagai dimensi. Mereka menganalisis jejak agen dan memberikan skor kuantitatif berdasarkan kriteria tertentu seperti bantuan, akurasi, atau metrik bisnis khusus. AgentCore Evaluasi menawarkan evaluator bawaan untuk kasus penggunaan umum dan evaluator pihak ketiga dari pustaka evaluasi sumber terbuka. Anda juga dapat membuat evaluator khusus yang disesuaikan dengan kebutuhan spesifik Anda.
Built-in evaluator
Built-in evaluator adalah solusi pra-konfigurasi yang menggunakan Large Language Models (LLM) sebagai juri untuk mengevaluasi kinerja agen. Evaluator ini dilengkapi dengan konfigurasi yang telah ditentukan sebelumnya, termasuk templat prompt yang dibuat dengan cermat, model evaluator yang dipilih, dan kriteria penilaian standar.
Built-in evaluator dirancang untuk memenuhi kebutuhan evaluasi umum sambil memastikan konsistensi dan keandalan di seluruh penilaian. Karena mereka adalah bagian dari penawaran kami yang dikelola sepenuhnya, Anda dapat menggunakannya segera tanpa konfigurasi tambahan, dan kami akan terus meningkatkan kualitasnya dan menambahkan evaluator baru dari waktu ke waktu. Untuk menjaga konsistensi dan keandalan, konfigurasi evaluator bawaan tidak dapat dimodifikasi.
Third-party evaluator
Third-party evaluator berasal dari pust DeepEval aka AutoEval open source. Amazon Bedrock mengelol AgentCore anya dengan cara yang sama seperti evaluator bawaan. Pilih evaluator pihak ketiga berdasarkan ID dan layanan menjalankannya—tidak perlu model atau konfigurasi. Anda juga dapat memperoleh evaluator khusus dari evaluator bawaan atau pihak ketiga untuk menjalankan logikanya pada model Anda sendiri. Untuk informasi lebih lanjut, lihat Third-party evaluator.
Evaluator kustom
Evaluator kustom menawarkan lebih banyak fleksibilitas dengan memungkinkan Anda untuk menentukan semua aspek proses evaluasi Anda. AgentCore Evaluasi mendukung jenis evaluator kustom berikut:
-
LLM-as-a-judge evaluator — Tentukan model evaluator Anda sendiri, instruksi evaluasi, dan skema penilaian. Anda dapat menyesuaikan evaluasi dengan kebutuhan spesifik Anda dengan memilih model evaluator, menyusun instruksi evaluasi khusus, menentukan kriteria evaluasi khusus, dan merancang skema penilaian Anda sendiri. Untuk informasi selengkapnya, lihat Evaluator Evaluator kustom kustom.
-
Code-based evaluator — Gunakan fungsi AWS Lambda Anda sendiri untuk mengevaluasi kinerja agen secara terprogram. Pendekatan ini memberi Anda kontrol penuh atas logika evaluasi, memungkinkan pemeriksaan deterministik, panggilan API eksternal, pencocokan regex, metrik khusus, atau aturan khusus bisnis apa pun tanpa bergantung pada juri LLM. Untuk informasi selengkapnya, lihat Evaluator berbasis kode khusus.
-
Evaluator berasal dari evaluator dasar — Jalankan logika evaluator bawaan atau pihak ketiga yang ada pada model dan inferensi Anda sendiri, alih-alih model yang dipilih layanan. Untuk informasi lebih lanjut, lihat Third-party evaluator.
Tingkat penyesuaian ini sangat berharga ketika Anda perlu mengevaluasi agen khusus domain, menerapkan standar kualitas unik, atau menerapkan sistem penilaian khusus. Misalnya, Anda dapat membuat kriteria evaluasi khusus untuk industri tertentu seperti perawatan kesehatan atau keuangan, atau merancang skema penilaian yang selaras dengan metrik kualitas organisasi Anda.