View a markdown version of this page

Avaliação do conjunto de dados - Amazon Bedrock AgentCore

Avaliação do conjunto de dados

nota

A avaliação do conjunto de dados está em pré-visualização pública. Os recursos e as APIs podem mudar antes da disponibilidade geral.

As avaliações do conjunto de dados permitem que você comporte seu agente em um conjunto de cenários e avalie automaticamente os resultados. Em vez de invocar manualmente seu agente, coletar intervalos e chamar a API Evaluate, um executor de conjunto de dados orquestra todo o ciclo de vida em uma única chamada: invoca o agente, aguarda a ingestão da telemetria e avalia.

Isso é útil para testes de regressão, conjuntos de dados de benchmark, CI/CD pipelines, medição de linha de base e pre/post comparação após alterações na configuração.

O AgentCore SDK fornece dois executores de conjuntos de dados que compartilham o mesmo esquema de conjunto de dados e formato de verdade fundamental, mas diferem no local em que a avaliação acontece:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) — coleta extensões e chama a API Evaluate do lado do cliente. Ideal para iteração em tempo de desenvolvimento e pequenos conjuntos de dados.

  • Batch dataset runner (BatchEvaluationRunner) — delega a coleta e a avaliação de abrangência ao serviço por meio da API de avaliação em lote. Ideal para grandes conjuntos de dados e linhas de base de produção.

Escolhendo um corredor

Aspecto On-demand corredor Batch runner

Coleção Span

SDK-side via AgentSpanCollector

Server-side; o serviço lê CloudWatch diretamente

Avalie as chamadas de API

Chamadas de SDK evaluate() por avaliador por cenário

O SDK chama startBatchEvaluation() uma vez

Modelo de execução

Tubulação trifásica síncrona (invocar, esperar, avaliar)

Pipeline assíncrono de quatro fases (invocar, esperar, enviar, sondar)

Resultados

Estruturado EvaluationResult com detalhes por cenário e por avaliador

Agregue BatchEvaluationSummary com médias por avaliador, além de detalhes por sessão em CloudWatch

Melhor para

Dev-time iteração CI/CD, pequenos conjuntos de dados, quando você precisa imediatamente de detalhes por cenário

Medição de linha de base, grandes conjuntos de dados, pre/post comparação, quando pontuações agregadas são suficientes

Pré-requisitos

Ambos os corredores exigem: