View a markdown version of this page

評估工具 - Amazon Bedrock AgentCore

本文為英文版的機器翻譯版本,如內容有任何歧義或不一致之處,概以英文版為準。

評估工具

評估者是評估客服人員在不同維度效能的核心元件。他們會分析客服人員追蹤,並根據協助性、準確性或自訂業務指標等特定條件提供量化分數。AgentCore Evaluations 為來自開放原始碼評估程式庫的常見使用案例和第三方評估程式提供內建評估程式。您也可以根據特定需求建立自訂評估者。

內建評估器

內建評估器是預先設定的解決方案,使用大型語言模型 (LLMs) 做為評估客服人員效能的判斷。這些評估器隨附預先定義的組態,包括精心製作的提示範本、選取的評估器模型,以及標準化的評分標準。

內建評估器旨在解決常見的評估需求,同時確保評估之間的一致性和可靠性。由於它們是全受管產品的一部分,因此您可以立即使用它們,而不需要任何額外的組態,而且我們會持續改善其品質,並隨著時間增加新的評估者。為了保持一致性和可靠性,無法修改內建評估器的組態。

第三方評估者

第三方評估者來自 DeepEval 和 AutoEval 開放原始碼程式庫。Amazon Bedrock AgentCore 的管理方式與內建評估器相同。依 ID 選取第三方評估者,服務會執行該評估者,而不需要模型或組態。您也可以從內建或第三方評估器衍生自訂評估器,以在您自己的模型上執行其邏輯。如需詳細資訊,請參閱第三方評估者。

自訂評估器

自訂評估者可讓您定義評估程序的所有層面,藉此提供更多彈性。AgentCore Evaluations 支援下列類型的自訂評估程式:

  • LLM-as-a-judge 評估者 – 定義您自己的評估者模型、評估指示和評分結構描述。您可以透過選取評估器模型、制定自訂評估指示、定義特定評估條件,以及設計自己的評分結構描述,來根據您的特定需求量身打造評估。如需詳細資訊,請參閱自訂評估器。

  • 程式碼型評估器 – 使用您自己的 AWS Lambda 函數以程式設計方式評估代理程式效能。此方法可讓您完全控制評估邏輯,啟用確定性檢查、外部 API 呼叫、regex 比對、自訂指標或任何業務特定規則,而無需依賴 LLM 判斷。如需詳細資訊,請參閱自訂程式碼型評估器。

  • 評估者衍生自基礎評估者 – 在您自己的模型和推論上執行現有的內建或第三方評估者的邏輯,而不是服務選擇的模型。如需詳細資訊,請參閱第三方評估者。

當您需要評估特定網域的代理程式、套用唯一品質標準或實作專門的評分系統時,此自訂層級特別有價值。例如,您可以為醫療保健或金融等特定產業建立自訂評估條件,或設計符合組織品質指標的評分結構描述。