View a markdown version of this page

Evaluator keterampilan - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Evaluator keterampilan

Keter ampilan adalah file SKILL.md instruksi yang dapat digunakan kembali yang dimuat agen saat runtime untuk membantu tugas. Keterampilan mengikuti standar Keterampilan Agen terbuka untuk struktur file keterampilan. Untuk terminologi, lihat Keterampilan.

AgentCore Evaluasi menyediakan dua evaluator bawaan untuk agen yang menggunakan keterampilan. Keduanya adalah evaluator tingkat alat. AgentCore Evaluasi memancarkan satu hasil per pemanggilan keterampilan dan menghubungkan setiap hasil ke rentang panggilan alat yang memuat keterampilan. Sesi dengan tiga pemanggilan keterampilan menghasilkan tiga hasil per evaluator.

Anda dapat menggunakan evaluator ini dengan evaluasi on-demand, batch, dan online. Untuk isi prompt yang tepat, lihat Akurasi pemilihan keterampilan dan instruksi Keterampilan berikut di halaman templ at Prompt.

Builtin.SkillSelectionAccuracy

Evaluator akurasi pemilihan keterampilan (Builtin.SkillSelectionAccuracy) menilai apakah keterampilan yang dimuat agen sesuai dengan tugas, mengingat katalog keterampilan yang tersedia. Ini mengembalikan Yes (1.0) atau No (0.0).

Placeholder yang digunakan evaluator:

  • invoked_skill— Nama keterampilan yang dimuat agen dalam panggilan alat ini.

  • available_skills— Katalog keterampilan yang dapat dipilih agen saat runtime. Tidak setiap kerangka mengekspos katalog. Ketika katalog tidak ada dalam jejak, placeholder ini kosong dan evaluator menilai keterampilan yang dipanggil terhadap permintaan pengguna dan konteks percakapan saja.

  • user_message— Permintaan pengguna pada gilirannya yang memicu pemanggilan keterampilan.

  • context— Sebelumnya muncul panggilan alat yang sedang dievaluasi.

Evaluator berjalan setiap kali AgentCore Evaluasi mendeteksi pemanggilan keterampilan. Ini berfokus pada keputusan seleksi, bukan pada seberapa baik agen kemudian mengeksekusi keterampilan.

Builtin.SkillInstructionFollowing

Instruksi Keterampilan mengikuti evaluator (Builtin.SkillInstructionFollowing) menilai seberapa penuh agen mengikuti langkah-langkah yang ditentukan keterampilan yang dimuat. Ini mengembalikan Fully Followed (1.0), Mostly Followed (0.75), Partially Followed (0.5), Minimally Followed (0.25), atau Not Followed (0.0).

Placeholder yang digunakan evaluator:

  • invoked_skill— Nama keterampilan yang dimuat agen dalam panggilan alat ini.

  • skill_content— Seluruh SKILL.md instruksi skill yang dimuat.

  • context— Kon teks sesi penuh — setiap putaran dari sesi mulai hingga akhir sesi. Karena agen dapat melakukan langkah-langkah yang ditentukan kapan saja setelah memuat keterampilan, juri membutuhkan seluruh sesi, bukan hanya giliran hingga panggilan alat.

Evaluator hanya berjalan ketika keterampilan yang dipanggil dan SKILL.md tubuhnya hadir dalam jejak. Hakim mengidentifikasi langkah-langkah yang ditentukan dalam badan keterampilan, kemudian, untuk setiap langkah, menentukan dari catatan percakapan apakah langkah tersebut sepenuhnya dilakukan, sebagian dilakukan, atau dilewati, dan menghasilkan peringkat keseluruhan yang konsisten dengan perincian per langkah itu.

Dukungan kerangka kerja

AgentCore Evaluasi mendeteksi pemanggilan keterampilan dari dua jenis sinyal jejak: pembacaan file sistem SKILL.md file, dan alat pemuatan keterampilan asli kerangka kerja. Sinyal baca sistem file berfungsi untuk kerangka kerja apa pun. Sinyal alat asli berlaku untuk kerangka kerja tertentu di baris kedua dari tabel berikut.

Metode deteksi

Kerangka Kerja

SKILL.mdmembaca file (universal)

LlamaIndex, Agen OpenAI, dan agen apa pun yang membaca SKILL.md melalui alat baca file generik.

Alat pemuatan keterampilan asli (selain membaca file)

Agen Strands, LangGraph Agen Dalam, Google ADK, Claude Agen SDK.

Untuk jalur baca file, AgentCore Evaluasi mencocokkan panggilan alat sebagai beban keterampilan ketika parameternya berisi jalur yang berakhir di /SKILL.md dan badan hasil alat adalah SKILL.md file yang terbentuk dengan baik (frontmatter dengan description bidang name dan, diikuti oleh badan instruksi).

Katalog keterampilan yang tersedia dipancarkan secara asli oleh Strands Agents, LangGraph Deep Agents, dan Google ADK. Claude Agent SDK dan agen baca file tidak mengeluarkan katalog. Builtin.SkillSelectionAccuracymasih berjalan pada agen tersebut, dengan available_skills placeholder kosong.

Untuk pengaturan instrumentasi umum dan nama cakupan per kerangka kerja, lihat Kerangka kerja agen yang didukung.

Perilaku melewatkan

AgentCore Evaluasi mengklasifikasikan panggilan alat sebagai pemanggilan keterampilan ketika jejak mengekspos invoked_skill atau skill_content untuk panggilan itu. Jika tidak ada sinyal, AgentCore Evaluasi melewatkan kedua evaluator keterampilan untuk panggilan itu dan tidak memancarkan hasil. Jika agen Anda tidak memuat keterampilan apa pun, kedua evaluator menghasilkan nol hasil untuk sesi tersebut — ini diharapkan, bukan kesalahan.

Jika agen Anda memuat keterampilan tetapi evaluator masih tidak mengembalikan hasil, jalankan keterampilan diagnostik di Sumber keterampilan Diagnostik untuk mengonfirmasi bahwa jejak membawa sinyal yang diharapkan.

Placeholder keterampilan untuk evaluator kustom

Anda dapat menulis evaluator TOOL_CALL khusus yang memberi alasan tentang keterampilan yang dimuat agen. Placeholder keterampilan yang dijelaskan di atas (invoked_skill,, skill_contentavailable_skills,user_message) tersedia untuk evaluator TOOL_CALL khusus apa pun di samping placeholder tingkat alat standar (,,). context available_tools tool_turn Session-level dan evaluator kustom tingkat jejak tidak dapat menggunakan placeholder ini.

Bagaimana AgentCore Evaluasi berperilaku tergantung pada placeholder keterampilan mana yang direferensikan evaluator kustom:

  • Evaluator yang mereferensi invoked_skill kan berperilaku sepertiBuiltin.SkillSelectionAccuracy: hanya berjalan pada panggilan alat pemanggilan keterampilan, dan merender snapshot pra-panggilan {context} standar.

  • Evaluator yang merefer skill_content ensikan berperilaku sepertiBuiltin.SkillInstructionFollowing: ia hanya berjalan pada panggilan alat {context} pemanggilan keterampilan yang SKILL.md tubuhnya tersedia, dan merender konteks sesi penuh — setiap putaran dari awal sesi hingga akhir sesi. Ini berbeda dari tingkat alat standar. context

Dalam kedua kasus tersebut, AgentCore Evaluasi memancarkan satu hasil per pemanggilan keterampilan. Untuk penulisan evaluator khusus, lihat Membuat evaluator.