View a markdown version of this page

Evaluación del conjunto de datos - Base amazónica AgentCore

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Evaluación del conjunto de datos

nota

La evaluación del conjunto de datos está en versión preliminar pública. Las funciones y las API pueden cambiar antes de la disponibilidad general.

Las evaluaciones de conjuntos de datos le permiten comparar su agente con un conjunto de escenarios y evaluar automáticamente los resultados. En lugar de invocar manualmente al agente, recopilar los intervalos y llamar a la API de evaluación, un ejecutor de conjuntos de datos organiza todo el ciclo de vida en una sola llamada: invoca al agente, espera a que se ingiera la telemetría y evalúa.

Esto resulta útil para realizar pruebas de regresión, comparar conjuntos de datos, CI/CD canalizaciones, realizar mediciones de referencia y realizar comparaciones después de realizar cambios en la configuración. pre/post

El AgentCore SDK proporciona dos ejecutores de conjuntos de datos que comparten el mismo esquema de conjunto de datos y el mismo formato básico de datos, pero que difieren en cuanto al lugar donde se realiza la evaluación:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner): recopila los intervalos y llama a la API de evaluación desde el lado del cliente. Ideal para la iteración en tiempo de desarrollo y para conjuntos de datos pequeños.

  • Ejecutor de conjuntos de datos por lotes (BatchEvaluationRunner): los delegados distribuyen la recopilación y la evaluación al servicio mediante la API de evaluación por lotes. Ideal para bases de producción y conjuntos de datos de gran tamaño.

Cómo elegir un corredor

Aspecto On-demand corredor corredor de lotes

Colección Span

SDK-side vía AgentSpanCollector

Server-side; el servicio lee CloudWatch directamente

Evalúe las llamadas de API

Llamadas evaluate() al SDK por evaluador por escenario

El SDK llama una vez startBatchEvaluation()

Modelo de ejecución

Canalización trifásica sincrónica (invocar, esperar, evaluar)

Canalización asincrónica de cuatro fases (invocar, esperar, enviar, sondear)

Resultados

Estructurado EvaluationResult con detalles por escenario y por evaluador

Agregue BatchEvaluationSummary los promedios por evaluador y los detalles por sesión en CloudWatch

Lo mejor para

Dev-time iteración, conjuntos de datos pequeños CI/CD, cuando necesite detalles por escenario de forma inmediata

Medición de referencia, conjuntos de datos grandes, pre/post comparación, cuando las puntuaciones agregadas son suficientes

Requisitos previos

Ambos corredores necesitan:

  • Python 3.10 o superior

  • Un agente creado con un marco y una biblioteca de instrumentación compatibles. Para obtener más información sobre los marcos y bibliotecas de instrumentación compatibles, consulte los marcos de agentes compatibles.

  • Un agente implementado en AgentCore Runtime con la observabilidad habilitada o un agente creado con un marco compatible configurado con AgentCore Observability, incluida la búsqueda de transacciones. Para obtener más información sobre la configuración de la telemetría, consulte Configuración y entrega de la telemetría.

  • El SDK instalado: AgentCore pip install bedrock-agentcore

  • AWS credenciales configuradas con permisos para bedrock-agentcorebedrock-agentcore-control, y logs () CloudWatch