View a markdown version of this page

Terminología de evaluación - Base amazónica AgentCore

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Terminología de evaluación

La comprensión de los conceptos y la terminología clave es esencial para utilizar AgentCore las evaluaciones de forma eficaz. Los siguientes términos definen los componentes y procesos principales que intervienen en la evaluación de los agentes.

Marco de agentes

Un marco de agentes proporciona los componentes fundamentales para crear, organizar y ejecutar aplicaciones basadas en agentes. Los marcos definen estructuras como los pasos, las herramientas, el flujo de control y la administración de la memoria. Los marcos industriales comunes incluyen Strands Agents en el sitio web de Strands y LangGraph. Estos marcos ayudan a estandarizar la forma en que se construyen los agentes y facilitan su instrumentación y evaluación.

Para obtener más información sobre los marcos compatibles, consulte los marcos de agentes compatibles.

Biblioteca de instrumentación

Una biblioteca de instrumentación registra la telemetría generada por su agente durante la ejecución. Esta telemetría puede incluir seguimientos, intervalos, llamadas a herramientas, invocaciones de modelos y pasos intermedios. Las bibliotecas de este tipo OpenInference ofrecen API estandarizadas y convenciones semánticas que permiten capturar el comportamiento de los agentes con cambios mínimos en el código. OpenTelemetry Se requiere instrumentación para la recopilación y evaluación de los rastros.

Para obtener más información sobre las bibliotecas de instrumentación compatibles, consulte los marcos de agentes compatibles.

Agente de instrumentación

Un agente de instrumentación captura automáticamente la telemetría del código de la aplicación, la procesa y la exporta a un servicio de respaldo para su almacenamiento o evaluación. Las herramientas como ADOT (AWS Distro for OpenTelemetry) proporcionan un agente de autoinstrumentación, independiente del proveedor y listo para la producción, que inyecta códigos de bytes de forma dinámica para capturar los rastros sin cambiar el código. El agente es un componente clave para permitir la evaluación automatizada.

AgentCore Actualmente, Evaluations admite ADOT (AWS Distro for OpenTelemetry) como agente de instrumentación.

Session

Una sesión representa una agrupación lógica de interacciones relacionadas de un solo usuario o flujo de trabajo. Una sesión puede contener uno o más rastros. Las sesiones ayudan a ver y evaluar el comportamiento de los agentes en las interacciones de varios pasos, en lugar de centrarse en las solicitudes individuales.

Rastreo

Un rastro es un registro completo de la ejecución o solicitud de un solo agente. Un seguimiento contiene uno o más intervalos, que representan las operaciones individuales realizadas durante esa ejecución. Los rastreos proporcionan una visibilidad integral de las decisiones de los agentes y el uso de las herramientas.

Tool Call

Una llamada a una herramienta es un intervalo que representa la invocación por parte de un agente de una función, API o capacidad externa. Los intervalos de llamadas a herramientas suelen capturar información como el nombre de la herramienta, los parámetros de entrada, el tiempo de ejecución y la salida. Los detalles de las llamadas a las herramientas se utilizan para evaluar si el agente seleccionó y usó las herramientas de manera correcta y eficiente.

Habilidad

Una habilidad es un archivo de instrucciones reutilizable que un agente carga en tiempo de ejecución para ayudar con una tarea. Las habilidades siguen el estándar abierto Agent Skills para la estructura de archivos de habilidades. Durante el tiempo de ejecución, el agente selecciona una habilidad del catálogo que se le mostró o lee el SKILL.md archivo directamente desde el sistema de archivos. AgentCore Las evaluaciones detectan las invocaciones de habilidades a partir de los rastros de un agente. Para evaluarlas, utilice los evaluadores de habilidades integrados o los evaluadores TOOL_CALL personalizados que hacen referencia a los marcadores de posición de las habilidades. Crear evaluador

Haga referencia a los modelos lingüísticos extensos gratuitos (LLM) como jueces

Los modelos lingüísticos extensos (LLM), cuando se consideran jueces, se refieren a un método de evaluación que utiliza un modelo lingüístico extenso (LLM) para evaluar automáticamente la calidad, la corrección o la eficacia de los resultados de un agente o de otro modelo. En lugar de basarse en la revisión manual o en las comprobaciones basadas en reglas, el LLM se basa en criterios de evaluación y produce una puntuación, una etiqueta o una explicación en función de los datos y resultados que se evalúan. A diferencia de las evaluaciones tradicionales, que se basan en datos reales, los LLM-as-a-judge métodos se basan en el conocimiento interno del modelo para emitir juicios. Este enfoque permite realizar evaluaciones cualitativas escalables, coherentes y personalizables, como la exactitud, la calidad del razonamiento o el cumplimiento de las instrucciones, en un gran número de interacciones entre agentes o respuestas de modelos.