Evaluación del conjunto de datos
nota
La evaluación del conjunto de datos está en versión preliminar pública. Las funciones y las API pueden cambiar antes de que estén disponibles para el público en general.
Las evaluaciones de los conjuntos de datos le permiten ejecutar su agente en un conjunto de escenarios y evaluar automáticamente los resultados. En lugar de invocar manualmente al agente, recopilar los intervalos y llamar a la API Evaluate, un administrador de conjuntos de datos organiza todo el ciclo de vida con una sola llamada: invoca al agente, espera a que se ingiera la telemetría y evalúa.
Esto resulta útil para las pruebas de regresión, los conjuntos de datos de referencia, los CI/CD procesos, la medición de referencia y la comparación después de los cambios de configuración. pre/post
El AgentCore SDK proporciona dos ejecutores de conjuntos de datos que comparten el mismo esquema de conjunto de datos y el mismo formato de datos básicos, pero difieren en el lugar donde se realiza la evaluación:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner): recopila extensiones y llama a la API Evaluate desde el lado del cliente. Ideal para iteraciones en tiempo de desarrollo y conjuntos de datos pequeños. -
Ejecutor de conjuntos de datos por lotes (
BatchEvaluationRunner): delega la recopilación y evaluación de tramos al servicio a través de la API de evaluación por lotes. Ideal para grandes conjuntos de datos y líneas base de producción.
Elegir un corredor
| Aspecto | On-demand corredor | Batch Runner |
|---|---|---|
|
Colección Span |
SDK-side vía |
Server-side; el servicio lee CloudWatch directamente desde |
|
Evalúa las llamadas de API |
Llamadas |
El SDK llama |
|
Modelo de ejecución |
Canalización trifásica síncrona (invocar, esperar, evaluar) |
Canalización cuatrifásica asíncrona (invocar, esperar, enviar, sondear) |
|
Resultados |
Estructurado |
Agregue |
|
Lo mejor para |
Dev-time iteración, conjuntos de datos pequeños CI/CD, cuando necesite detalles por escenario de forma inmediata |
Medición de referencia, conjuntos de datos grandes, pre/post comparación, cuando las puntuaciones agregadas son suficientes |
Requisitos previos
Ambos corredores requieren:
-
Python 3.10 o versiones posteriores
-
Un agente implementado en AgentCore Runtime con la observabilidad habilitada o un agente creado con un marco compatible configurado con Observability. AgentCore Marcos compatibles:
-
Strands Agents
-
LangGraph con
opentelemetry-instrumentation-langchainoopeninference-instrumentation-langchain
-
-
La búsqueda de transacciones está habilitada en CloudWatch; consulte Habilitar la búsqueda de transacciones
-
El AgentCore SDK instalado:
pip install bedrock-agentcore -
AWS credenciales configuradas con permisos para
bedrock-agentcorebedrock-agentcore-control, ylogs(CloudWatch)