View a markdown version of this page

评估程序 - 亚马逊基岩 AgentCore

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

评估程序

评估器是评估代理在不同维度的表现的核心组成部分。他们分析代理跟踪信息,并根据特定标准(例如帮助性、准确性或自定义业务指标)提供定量分数。 AgentCore 评估为常见用例提供内置评估器,并提供来自开源评估库的第三方评估器。您还可以创建根据您的特定要求量身定制的自定义评估器。

Built-in 评估人员

Built-in 评估人员是预先配置的解决方案,使用大型语言模型 (LLM) 作为判断来评估代理绩效。这些评估器带有预定义的配置,包括精心设计的提示模板、精选的评估者模型和标准化的评分标准。

Built-in 评价人员旨在满足共同的评价需求, 同时确保各项评估的一致性和可靠性。由于它们是我们完全托管的产品的一部分,因此您无需进行任何额外配置即可立即使用它们,随着时间的推移,我们将继续提高其质量并增加新的评估人员。为了保持一致性和可靠性,无法修改内置评估器的配置。

Third-party 评估人员

Third-party 评估人员来自 DeepEval 和 AutoEval 开源库。亚马逊 Bedrock 对它们的 AgentCore 管理方式与内置评估器相同。按 ID 选择第三方评估器,服务即可运行该评估器,无需模型或配置。您也可以从内置或第三方评估器派生自定义评估器,以在自己的模型上运行其逻辑。有关更多信息,请参阅Third-party 评估器。

自定义评估器

自定义评估器允许您定义评估过程的各个方面,从而提供更大的灵活性。 AgentCore 评估支持以下类型的自定义评估器:

  • LLM-as-a-judge 评估者 -定义自己的评估者模型、评估说明和评分方案。您可以通过选择评估者模型、制定自定义评估说明、定义特定的评估标准以及设计自己的评分架构来根据您的特定需求量身定制评估。有关更多信息,请参阅自定义评估器。

  • Code-based 评估器 — 使用您自己的 AWS Lambda 函数以编程方式评估代理性能。这种方法使您可以完全控制评估逻辑,无需依赖 LLM 判断即可实现确定性检查、外部 API 调用、正则表达式匹配、自定义指标或任何特定业务规则。有关更多信息,请参阅基于代码的自定义评估器。

  • 源自基础评估器的评估器 — 根据您自己的模型和推断,而不是服务选择的模型,运行现有内置或第三方评估器的逻辑。有关更多信息,请参阅Third-party 评估器。

当您需要评估特定领域的代理、应用独特的质量标准或实施专门的评分系统时,这种定制级别尤其有价值。例如,您可以为医疗保健或金融等特定行业创建自定义评估标准,或者设计与组织质量指标相一致的评分方案。