View a markdown version of this page

评估术语 - 亚马逊基岩 AgentCore

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

评估术语

了解关键概念和术语对于有效使用 AgentCore 评估至关重要。以下术语定义了代理评估所涉及的核心组件和流程。

代理框架

代理框架为构建、协调和运行基于代理的应用程序提供了基础组件。框架定义了诸如步骤、工具、控制流和内存管理之类的结构。常见的行业框架包括 Strands网站上的Strands Agents以及. LangGraph 这些框架有助于标准化代理的构造方式,使其更易于检测和评估。

有关支持的框架的更多信息,请参阅支持的代理框架。

仪器库

仪器库记录您的代理在执行期间生成的遥测数据。这种遥测可以包括轨迹、跨度、工具调用、模型调用和中间步骤。OpenTelemetry和等库OpenInference提供标准化的 API 和语义约定,允许您以最少的代码更改来捕获代理行为。跟踪收集和评估需要仪器。

有关支持的仪器库的更多信息,请参阅支持的代理框架。

仪器代理

仪器代理会自动从应用程序代码中捕获遥测数据,对其进行处理,然后将其导出到后端服务进行存储或评估。诸如 ADOT(AWS Distro for OpenTelemetry)之类的工具提供了一种与供应商无关、可随时投入生产的自动仪表代理,该代理可以动态注入字节码以捕获痕迹,而无需更改代码。该代理是实现自动评估的关键组件。

AgentCore 评估版目前支持 ADOT(AWS 发行版 OpenTelemetry)作为仪器代理。

会话

会话指单个用户或工作流相关交互行为的逻辑集合。一个会话可能包含一条或多条跟踪。会话可帮助您查看和评估代理在多步骤交互中的行为,而不是专注于单个请求。

追踪

跟踪数据为代理单次执行任务或处理请求的完整记录。跟踪包含一个或多个跨度,这些跨度表示在该执行期间执行的各个操作。跟踪提供对代理决策和工具使用情况的端到端可见性。

工具调用

工具调用是一个跨度,表示代理对外部函数、API 或功能的调用。工具调用跨度通常捕获工具名称、输入参数、执行时间和输出等信息。工具调用详细信息用于评估代理是否正确有效地选择和使用了工具。

技能

技能是一种可重复使用的指令文件,代理在运行时加载该文件以帮助完成任务。技能遵循开放的代理技能标准的技能文件结构。运行时,代理从显示的目录中选择技能,或者直接从SKILL.md文件系统读取文件。 AgentCore 评估会从代理的痕迹中检测技能调用。要对其进行评估,请使用内置技能评估器或引用技能占位符的自定义 TOOL_CALL 评估器。创建评估器

作为评委免费参考大型语言模型 (LLM)

作为判断的大型语言模型(LLM)是指一种评估方法,该方法使用大型语言模型(LLM)来自动评估代理或其他模型输出的质量、正确性或有效性。LLM 不依赖人工审查或基于规则的检查,而是提示他们提供评估标准,并根据正在评估的输入和输出生成分数、标签或解释。与依赖实地真相数据的传统评估不同, LLM-as-a-judge 方法依赖模型的内部知识来做出判断。这种方法可以对大量代理人交互或模型响应进行可扩展、一致和可自定义的定性评估,例如正确性、推理质量或教学依从性。