Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Evaluación del conjunto de datos
nota
La evaluación del conjunto de datos está en versión preliminar pública. Las funciones y las API pueden cambiar antes de la disponibilidad general.
Las evaluaciones de conjuntos de datos le permiten comparar su agente con un conjunto de escenarios y evaluar automáticamente los resultados. En lugar de invocar manualmente al agente, recopilar los intervalos y llamar a la API de evaluación, un ejecutor de conjuntos de datos organiza todo el ciclo de vida en una sola llamada: invoca al agente, espera a que se ingiera la telemetría y evalúa.
Esto resulta útil para realizar pruebas de regresión, comparar conjuntos de datos, CI/CD canalizaciones, realizar mediciones de referencia y realizar comparaciones después de realizar cambios en la configuración. pre/post
El AgentCore SDK proporciona dos ejecutores de conjuntos de datos que comparten el mismo esquema de conjunto de datos y el mismo formato básico de datos, pero que difieren en cuanto al lugar donde se realiza la evaluación:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner): recopila los intervalos y llama a la API de evaluación desde el lado del cliente. Ideal para la iteración en tiempo de desarrollo y para conjuntos de datos pequeños. -
Ejecutor de conjuntos de datos por lotes (
BatchEvaluationRunner): los delegados distribuyen la recopilación y la evaluación al servicio mediante la API de evaluación por lotes. Ideal para bases de producción y conjuntos de datos de gran tamaño.
Cómo elegir un corredor
| Aspecto | On-demand corredor | corredor de lotes |
|---|---|---|
|
Colección Span |
SDK-side vía |
Server-side; el servicio lee CloudWatch directamente |
|
Evalúe las llamadas de API |
Llamadas |
El SDK llama una vez |
|
Modelo de ejecución |
Canalización trifásica sincrónica (invocar, esperar, evaluar) |
Canalización asincrónica de cuatro fases (invocar, esperar, enviar, sondear) |
|
Resultados |
Estructurado |
Agregue |
|
Lo mejor para |
Dev-time iteración, conjuntos de datos pequeños CI/CD, cuando necesite detalles por escenario de forma inmediata |
Medición de referencia, conjuntos de datos grandes, pre/post comparación, cuando las puntuaciones agregadas son suficientes |
Requisitos previos
Ambos corredores necesitan:
-
Python 3.10 o superior
-
Un agente creado con un marco y una biblioteca de instrumentación compatibles. Para obtener más información sobre los marcos y bibliotecas de instrumentación compatibles, consulte los marcos de agentes compatibles.
-
Un agente implementado en AgentCore Runtime con la observabilidad habilitada o un agente creado con un marco compatible configurado con AgentCore Observability, incluida la búsqueda de transacciones. Para obtener más información sobre la configuración de la telemetría, consulte Configuración y entrega de la telemetría.
-
El SDK instalado: AgentCore
pip install bedrock-agentcore -
AWS credenciales configuradas con permisos para
bedrock-agentcorebedrock-agentcore-control, ylogs() CloudWatch