View a markdown version of this page

Evaluación del conjunto de datos - Amazon Bedrock AgentCore

Evaluación del conjunto de datos

nota

La evaluación del conjunto de datos está en versión preliminar pública. Las funciones y las API pueden cambiar antes de que estén disponibles para el público en general.

Las evaluaciones de los conjuntos de datos le permiten ejecutar su agente en un conjunto de escenarios y evaluar automáticamente los resultados. En lugar de invocar manualmente al agente, recopilar los intervalos y llamar a la API Evaluate, un administrador de conjuntos de datos organiza todo el ciclo de vida con una sola llamada: invoca al agente, espera a que se ingiera la telemetría y evalúa.

Esto resulta útil para las pruebas de regresión, los conjuntos de datos de referencia, los CI/CD procesos, la medición de referencia y la comparación después de los cambios de configuración. pre/post

El AgentCore SDK proporciona dos ejecutores de conjuntos de datos que comparten el mismo esquema de conjunto de datos y el mismo formato de datos básicos, pero difieren en el lugar donde se realiza la evaluación:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner): recopila extensiones y llama a la API Evaluate desde el lado del cliente. Ideal para iteraciones en tiempo de desarrollo y conjuntos de datos pequeños.

  • Ejecutor de conjuntos de datos por lotes (BatchEvaluationRunner): delega la recopilación y evaluación de tramos al servicio a través de la API de evaluación por lotes. Ideal para grandes conjuntos de datos y líneas base de producción.

Elegir un corredor

Aspecto On-demand corredor Batch Runner

Colección Span

SDK-side vía AgentSpanCollector

Server-side; el servicio lee CloudWatch directamente desde

Evalúa las llamadas de API

Llamadas evaluate() al SDK por evaluador y por escenario

El SDK llama startBatchEvaluation() una vez

Modelo de ejecución

Canalización trifásica síncrona (invocar, esperar, evaluar)

Canalización cuatrifásica asíncrona (invocar, esperar, enviar, sondear)

Resultados

Estructurado EvaluationResult con detalles por escenario y por evaluador

Agregue BatchEvaluationSummary los promedios por evaluador y los detalles por sesión CloudWatch

Lo mejor para

Dev-time iteración, conjuntos de datos pequeños CI/CD, cuando necesite detalles por escenario de forma inmediata

Medición de referencia, conjuntos de datos grandes, pre/post comparación, cuando las puntuaciones agregadas son suficientes

Requisitos previos

Ambos corredores requieren: