Avaliação do conjunto de dados
nota
A avaliação do conjunto de dados está em pré-visualização pública. Os recursos e as APIs podem mudar antes da disponibilidade geral.
As avaliações do conjunto de dados permitem que você comporte seu agente em um conjunto de cenários e avalie automaticamente os resultados. Em vez de invocar manualmente seu agente, coletar intervalos e chamar a API Evaluate, um executor de conjunto de dados orquestra todo o ciclo de vida em uma única chamada: invoca o agente, aguarda a ingestão da telemetria e avalia.
Isso é útil para testes de regressão, conjuntos de dados de benchmark, CI/CD pipelines, medição de linha de base e pre/post comparação após alterações na configuração.
O AgentCore SDK fornece dois executores de conjuntos de dados que compartilham o mesmo esquema de conjunto de dados e formato de verdade fundamental, mas diferem no local em que a avaliação acontece:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner) — coleta extensões e chama a API Evaluate do lado do cliente. Ideal para iteração em tempo de desenvolvimento e pequenos conjuntos de dados. -
Batch dataset runner (
BatchEvaluationRunner) — delega a coleta e a avaliação de abrangência ao serviço por meio da API de avaliação em lote. Ideal para grandes conjuntos de dados e linhas de base de produção.
Escolhendo um corredor
| Aspecto | On-demand corredor | Batch runner |
|---|---|---|
|
Coleção Span |
SDK-side via |
Server-side; o serviço lê CloudWatch diretamente |
|
Avalie as chamadas de API |
Chamadas de SDK |
O SDK chama |
|
Modelo de execução |
Tubulação trifásica síncrona (invocar, esperar, avaliar) |
Pipeline assíncrono de quatro fases (invocar, esperar, enviar, sondar) |
|
Resultados |
Estruturado |
Agregue |
|
Melhor para |
Dev-time iteração CI/CD, pequenos conjuntos de dados, quando você precisa imediatamente de detalhes por cenário |
Medição de linha de base, grandes conjuntos de dados, pre/post comparação, quando pontuações agregadas são suficientes |
Pré-requisitos
Ambos os corredores exigem:
-
Python 3.10+
-
Um agente implantado no AgentCore Runtime com a observabilidade ativada ou um agente criado com uma estrutura compatível configurada com o Observability. AgentCore Estruturas suportadas:
-
Strands Agents
-
LangGraph com
opentelemetry-instrumentation-langchainouopeninference-instrumentation-langchain
-
-
Pesquisa de transações ativada em CloudWatch; consulte Ativar pesquisa de transações
-
O AgentCore SDK instalado:
pip install bedrock-agentcore -
AWS credenciais configuradas com permissões para
bedrock-agentcorebedrock-agentcore-control, elogs() CloudWatch