View a markdown version of this page

Evaluator - Batuan Dasar Amazon AgentCore

Evaluator

Evaluator adalah komponen inti yang menilai kinerja agen Anda di berbagai dimensi. Mereka menganalisis jejak agen dan memberikan skor kuantitatif berdasarkan kriteria tertentu seperti membantu, akurasi, atau metrik bisnis khusus. AgentCore Evaluasi menawarkan evaluator bawaan untuk kasus penggunaan umum dan fleksibilitas untuk membuat evaluator khusus yang disesuaikan dengan kebutuhan spesifik Anda.

Built-in evaluator

Built-in evaluator adalah solusi pra-konfigurasi yang menggunakan Large Language Models (LLM) sebagai juri untuk mengevaluasi kinerja agen. Evaluator ini dilengkapi dengan konfigurasi yang telah ditentukan, termasuk templat prompt yang dibuat dengan cermat, model evaluator yang dipilih, dan kriteria penilaian standar.

Built-in evaluator dirancang untuk memenuhi kebutuhan evaluasi umum sambil memastikan konsistensi dan keandalan di seluruh penilaian. Karena mereka adalah bagian dari penawaran kami yang dikelola sepenuhnya, Anda dapat menggunakannya segera tanpa konfigurasi tambahan, dan kami akan terus meningkatkan kualitasnya dan menambahkan evaluator baru dari waktu ke waktu. Untuk menjaga konsistensi dan keandalan, konfigurasi evaluator bawaan tidak dapat dimodifikasi.

Evaluator kustom

Evaluator khusus menawarkan lebih banyak fleksibilitas dengan memungkinkan Anda menentukan semua aspek proses evaluasi Anda. AgentCore Evaluasi mendukung dua jenis evaluator kustom:

  • LLM-as-a-judge evaluator — Tentukan model evaluator Anda sendiri, instruksi evaluasi, dan skema penilaian. Anda dapat menyesuaikan evaluasi dengan kebutuhan spesifik Anda dengan memilih model evaluator, menyusun instruksi evaluasi khusus, menentukan kriteria evaluasi spesifik, dan merancang skema penilaian Anda sendiri. Untuk informasi selengkapnya, lihat Evaluator khusus.

  • Code-based evaluator — Gunakan fungsi AWS Lambda Anda sendiri untuk mengevaluasi kinerja agen secara terprogram. Pendekatan ini memberi Anda kontrol penuh atas logika evaluasi, memungkinkan pemeriksaan deterministik, panggilan API eksternal, pencocokan regex, metrik khusus, atau aturan khusus bisnis apa pun tanpa bergantung pada hakim LLM. Untuk informasi selengkapnya, lihat Evaluator berbasis kode khusus.

Tingkat penyesuaian ini sangat berharga ketika Anda perlu mengevaluasi agen khusus domain, menerapkan standar kualitas unik, atau menerapkan sistem penilaian khusus. Misalnya, Anda dapat membuat kriteria evaluasi khusus untuk industri tertentu seperti perawatan kesehatan atau keuangan, atau skema penilaian desain yang selaras dengan metrik kualitas organisasi Anda.