评估程序
评估者是评估代理人在不同维度上的表现的核心组成部分。他们分析代理跟踪并根据特定标准(例如帮助性、准确性或自定义业务指标)提供定量分数。 AgentCore 评估既为常见用例提供了内置评估器,又可以灵活地创建根据您的特定要求量身定制的自定义评估器。
Built-in 评估者
Built-in 评估人员是预先配置的解决方案,使用大型语言模型 (LLM) 作为评判来评估代理绩效。这些评估器具有预定义的配置,包括精心制作的提示模板、精选的评估者模型和标准化的评分标准。
Built-in 评价人员旨在满足共同的评价需求, 同时确保各项评估的一致性和可靠性。由于它们是我们完全托管产品的一部分,因此您可以立即使用它们,而无需进行任何其他配置,而且随着时间的推移,我们将继续提高其质量并增加新的评估人员。为了保持一致性和可靠性,无法修改内置赋值器的配置。
自定义评估器
自定义评估器允许您定义评估过程的各个方面,从而提供更大的灵活性。 AgentCore 评估支持两种类型的自定义评估器:
-
LLM-as-a-judge 评估者-定义自己的评估者模型、评估说明和评分架构。您可以通过选择评估者模型、起草自定义评估说明、定义特定的评估标准以及设计自己的评分架构,根据自己的特定需求量身定制评估。有关更多信息,请参阅自定义赋值器。
-
Code-based 评估者-使用您自己的 Lamb AWS da 函数以编程方式评估代理性能。这种方法使您可以完全控制评估逻辑,无需依赖 LLM 评判即可实现确定性检查、外部 API 调用、正则表达式匹配、自定义指标或任何特定于业务的规则。有关更多信息,请参阅基于代码的自定义评估器。
当您需要评估特定领域的代理、应用独特的质量标准或实施专门的评分系统时,这种级别的定制特别有价值。例如,您可以为医疗保健或金融等特定行业创建自定义评估标准,或者设计与组织质量指标一致的评分架构。