View a markdown version of this page

Terminologi evaluasi - Batu Dasar Amazon AgentCore

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Terminologi evaluasi

Memahami konsep kunci dan terminologi sangat penting untuk menggunakan AgentCore Evaluasi secara efektif. Istilah-istilah berikut mendefinisikan komponen inti dan proses yang terlibat dalam evaluasi agen.

Kerangka Agen

Kerangka kerja agen menyediakan komponen dasar untuk membangun, mengatur, dan menjalankan aplikasi berbasis agen. Kerangka kerja mendefinisikan struktur seperti langkah-langkah, alat, aliran kontrol, dan manajemen memori. Kerangka kerja industri umum termasuk Strands Agents di situs web Strands dan LangGraph. Kerangka kerja ini membantu menstandarkan bagaimana agen dibangun dan membuatnya lebih mudah untuk diinstrumentasikan dan dievaluasi.

Untuk informasi selengkapnya tentang kerangka kerja yang didukung, lihat Ker angka kerja agen yang didukung.

Perpustakaan Instrumentasi

Pustaka instrumentasi mencatat telemetri yang dihasilkan oleh agen Anda selama eksekusi. Telemetri ini dapat mencakup jejak, rentang, panggilan alat, pemanggilan model, dan langkah perantara. Pustaka seperti OpenTelemetry dan OpenInference menawarkan API standar dan konvensi semantik yang memungkinkan Anda menangkap perilaku agen dengan perubahan kode minimal. Instrumentasi diperlukan untuk pengumpulan dan evaluasi jejak.

Untuk informasi selengkapnya tentang pustaka instrumentasi yang didukung, lihat Kerangka kerja agen yang didukung.

Agen Instrumentasi

Agen instrumentasi secara otomatis menangkap telemetri dari kode aplikasi, memprosesnya, dan mengekspornya ke layanan backend untuk penyimpanan atau evaluasi. Alat seperti ADOT (AWS Distro for OpenTelemetry) menyediakan agen instrumentasi otomatis siap produksi yang netral vendor yang secara dinamis menyuntikkan bytecode untuk menangkap jejak tanpa perubahan kode. Agen adalah komponen kunci dalam memungkinkan evaluasi otomatis.

AgentCore Evaluasi saat ini mendukung ADOT (AWS Distro for OpenTelemetry) sebagai agen instrumentasi.

Sesi

Sesi mewakili pengelompokan logis interaksi terkait dari satu pengguna atau alur kerja. Sesi mungkin berisi satu atau lebih jejak. Sesi membantu Anda melihat dan mengevaluasi perilaku agen di seluruh interaksi multi-langkah, daripada berfokus pada permintaan individu.

Jejak

Jejak adalah catatan lengkap dari eksekusi atau permintaan agen tunggal. Jejak berisi satu atau lebih rentang, yang mewakili operasi individu yang dilakukan selama eksekusi itu. Trace memberikan visibilitas ujung ke dalam keputusan agen dan penggunaan alat.

Panggilan Alat

Panggilan alat adalah rentang yang mewakili pemanggilan agen terhadap fungsi eksternal, API, atau kemampuan. Rentang panggilan alat biasanya menangkap informasi seperti nama alat, parameter input, waktu eksekusi, dan output. Detail panggilan alat digunakan untuk mengevaluasi apakah agen memilih dan menggunakan alat dengan benar dan efisien.

Keterampilan

Keterampilan adalah file instruksi yang dapat digunakan kembali yang dimuat agen saat runtime untuk membantu tugas. Keterampilan mengikuti standar Keterampilan Agen terbuka untuk struktur file keterampilan. Saat runtime, agen memilih keterampilan dari katalog yang ditampilkan, atau membaca SKILL.md file langsung dari sistem file. AgentCore Evaluasi mendeteksi pemanggilan keterampilan dari jejak agen. Untuk mengevaluasinya, gunakan evaluator keterampilan bawaan atau evaluator TOOL_CALL khusus yang mereferensikan placeholder keterampilan. Buat evaluator

Referensi Free Large Language Models (LLM) sebagai juri

Model Bahasa Besar (LLM) sebagai juri mengacu pada metode evaluasi yang menggunakan model bahasa besar (LLM) untuk secara otomatis menilai kualitas, kebenaran, atau efektivitas agen atau keluaran model lain. Alih-alih mengandalkan tinjauan manual atau pemeriksaan berbasis aturan, LLM diminta dengan kriteria evaluasi dan menghasilkan skor, label, atau penjelasan berdasarkan input dan output yang dievaluasi. Tidak seperti evaluasi tradisional yang mengandalkan data kebenaran dasar, LLM-as-a-judge metode mengandalkan pengetahuan internal model untuk membuat penilaian. Pendekatan ini memungkinkan penilaian kualitatif yang dapat diskalakan, konsisten, dan dapat disesuaikan, seperti kebenaran, kualitas penalaran, atau kepatuhan instruksi, di sejumlah besar interaksi agen atau respons model.