Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Terminología de evaluación
La comprensión de los conceptos y la terminología clave es esencial para utilizar AgentCore las evaluaciones de forma eficaz. Los siguientes términos definen los componentes y procesos principales que intervienen en la evaluación de los agentes.
Temas
Marco de agentes
Un marco de agentes proporciona los componentes fundamentales para crear, organizar y ejecutar aplicaciones basadas en agentes. Los marcos definen estructuras como los pasos, las herramientas, el flujo de control y la administración de la memoria. Los marcos industriales comunes incluyen Strands Agents
Para obtener más información sobre los marcos compatibles, consulte los marcos de agentes compatibles.
Biblioteca de instrumentación
Una biblioteca de instrumentación registra la telemetría generada por su agente durante la ejecución. Esta telemetría puede incluir seguimientos, intervalos, llamadas a herramientas, invocaciones de modelos y pasos intermedios. Las bibliotecas de este tipo OpenInference ofrecen API estandarizadas y convenciones semánticas que permiten capturar el comportamiento de los agentes con cambios mínimos en el código. OpenTelemetry Se requiere instrumentación para la recopilación y evaluación de los rastros.
Para obtener más información sobre las bibliotecas de instrumentación compatibles, consulte los marcos de agentes compatibles.
Agente de instrumentación
Un agente de instrumentación captura automáticamente la telemetría del código de la aplicación, la procesa y la exporta a un servicio de respaldo para su almacenamiento o evaluación. Las herramientas como ADOT (AWS Distro for OpenTelemetry) proporcionan un agente de autoinstrumentación, independiente del proveedor y listo para la producción, que inyecta códigos de bytes de forma dinámica para capturar los rastros sin cambiar el código. El agente es un componente clave para permitir la evaluación automatizada.
AgentCore Actualmente, Evaluations admite ADOT (AWS Distro for OpenTelemetry) como agente de instrumentación.
Session
Una sesión representa una agrupación lógica de interacciones relacionadas de un solo usuario o flujo de trabajo. Una sesión puede contener uno o más rastros. Las sesiones ayudan a ver y evaluar el comportamiento de los agentes en las interacciones de varios pasos, en lugar de centrarse en las solicitudes individuales.
Rastreo
Un rastro es un registro completo de la ejecución o solicitud de un solo agente. Un seguimiento contiene uno o más intervalos, que representan las operaciones individuales realizadas durante esa ejecución. Los rastreos proporcionan una visibilidad integral de las decisiones de los agentes y el uso de las herramientas.
Tool Call
Una llamada a una herramienta es un intervalo que representa la invocación por parte de un agente de una función, API o capacidad externa. Los intervalos de llamadas a herramientas suelen capturar información como el nombre de la herramienta, los parámetros de entrada, el tiempo de ejecución y la salida. Los detalles de las llamadas a las herramientas se utilizan para evaluar si el agente seleccionó y usó las herramientas de manera correcta y eficiente.
Habilidad
Una habilidad es un archivo de instrucciones reutilizable que un agente carga en tiempo de ejecución para ayudar con una tarea. Las habilidades siguen el estándar abierto SKILL.md archivo directamente desde el sistema de archivos. AgentCore Las evaluaciones detectan las invocaciones de habilidades a partir de los rastros de un agente. Para evaluarlas, utilice los evaluadores de habilidades integrados o los evaluadores TOOL_CALL personalizados que hacen referencia a los marcadores de posición de las habilidades. Crear evaluador
Haga referencia a los modelos lingüísticos extensos gratuitos (LLM) como jueces
Los modelos lingüísticos extensos (LLM), cuando se consideran jueces, se refieren a un método de evaluación que utiliza un modelo lingüístico extenso (LLM) para evaluar automáticamente la calidad, la corrección o la eficacia de los resultados de un agente o de otro modelo. En lugar de basarse en la revisión manual o en las comprobaciones basadas en reglas, el LLM se basa en criterios de evaluación y produce una puntuación, una etiqueta o una explicación en función de los datos y resultados que se evalúan. A diferencia de las evaluaciones tradicionales, que se basan en datos reales, los LLM-as-a-judge métodos se basan en el conocimiento interno del modelo para emitir juicios. Este enfoque permite realizar evaluaciones cualitativas escalables, coherentes y personalizables, como la exactitud, la calidad del razonamiento o el cumplimiento de las instrucciones, en un gran número de interacciones entre agentes o respuestas de modelos.