View a markdown version of this page

Terminología de evaluación - Amazon Bedrock AgentCore

Terminología de evaluación

Comprender los conceptos y la terminología clave es esencial para utilizar AgentCore las evaluaciones de forma eficaz. Los siguientes términos definen los componentes y procesos principales que intervienen en la evaluación de los agentes.

Marco de agentes

Un marco de agentes proporciona los componentes fundamentales para crear, organizar y ejecutar aplicaciones basadas en agentes. Los marcos definen estructuras como los pasos, las herramientas, el flujo de control y la administración de la memoria. Los marcos industriales más comunes incluyen Strands Agents, LangGraphetc. Estos marcos ayudan a estandarizar la forma en que se construyen los agentes y facilitan su instrumentación y evaluación.

AgentCore Actualmente, las evaluaciones respaldan los agentes y LangGraphlos marcos de agentes de Strands.

Biblioteca de instrumentación

Una biblioteca de instrumentación registra la telemetría generada por el agente durante la ejecución. Esta telemetría puede incluir trazas, intervalos, llamadas a herramientas, invocaciones a modelos y pasos intermedios. Estas bibliotecas OpenInferenceofrecen API estandarizadas OpenTelemetryy convenciones semánticas que permiten capturar el comportamiento de los agentes con cambios mínimos en el código. Se requiere instrumentación para la recopilación y evaluación de trazas.

AgentCore Actualmente, las evaluaciones son compatibles OpenTelemetryy funcionan OpenInferencecomo bibliotecas de instrumentación.

Agente de instrumentación

Un agente de instrumentación captura automáticamente la telemetría del código de la aplicación, la procesa y la exporta a un servicio interno para su almacenamiento o evaluación. Herramientas como ADOT (AWS Distro for OpenTelemetry) proporcionan un agente de autoinstrumentación independiente del proveedor y listo para la producción que inyecta código de bytes de forma dinámica para capturar trazas sin cambios en el código. El agente es un componente clave para permitir la evaluación automatizada.

AgentCore Actualmente, Evaluations es compatible con ADOT (AWS Distro for OpenTelemetry) como agente de instrumentación.

Session

Una sesión representa una agrupación lógica de interacciones relacionadas de un solo usuario o flujo de trabajo. Una sesión puede contener una o más trazas. Las sesiones le ayudan a ver y evaluar el comportamiento de los agentes en interacciones de varios pasos, en lugar de centrarse en las solicitudes individuales.

Rastreo

Un rastro es un registro completo de la ejecución o solicitud de un solo agente. Un seguimiento contiene uno o más intervalos, que representan las operaciones individuales realizadas durante esa ejecución. Los rastreos proporcionan una visibilidad integral de las decisiones de los agentes y del uso de las herramientas.

Tool Call

Una llamada a una herramienta es un intervalo que representa la invocación por parte de un agente de una función, API o capacidad externa. Los intervalos de llamadas a herramientas suelen capturar información como el nombre de la herramienta, los parámetros de entrada, el tiempo de ejecución y el resultado. Los detalles de las llamadas a las herramientas se utilizan para evaluar si el agente seleccionó y utilizó las herramientas de forma correcta y eficiente.

Consulte a Free Large Language Models (LLM) como jueces

Los modelos de lenguaje grande (LLM), como jueces, se refieren a un método de evaluación que utiliza un modelo de lenguaje grande (LLM) para evaluar automáticamente la calidad, la corrección o la eficacia de los resultados de un agente o de otro modelo. En lugar de basarse en una revisión manual o en controles basados en reglas, el LLM se basa en criterios de evaluación y produce una calificación, etiqueta o explicación en función de los datos de entrada y salida que se evalúan. A diferencia de las evaluaciones tradicionales, que se basan en datos fundamentados, los LLM-as-a-judge métodos se basan en el conocimiento interno del modelo para emitir juicios. Este enfoque permite realizar evaluaciones cualitativas escalables, coherentes y personalizables, como la exactitud, la calidad del razonamiento o el cumplimiento de las instrucciones, a partir de un gran número de interacciones entre agentes o respuestas de modelos.