View a markdown version of this page

Avaliação do conjunto de dados - Base da Amazônia AgentCore

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Avaliação do conjunto de dados

nota

A avaliação do conjunto de dados está em pré-visualização pública. Os recursos e as APIs podem mudar antes da disponibilidade geral.

As avaliações de conjuntos de dados permitem que você comporte seu agente em um conjunto de cenários e avalie automaticamente os resultados. Em vez de invocar manualmente seu agente, coletar períodos e chamar a API Evaluate, um executor de conjunto de dados orquestra todo o ciclo de vida em uma única chamada: invocar o agente, aguardar a ingestão de telemetria e avaliar.

Isso é útil para testes de regressão, conjuntos de dados de referência, CI/CD pipelines, medição de linha de base e pre/post comparação após alterações na configuração.

O AgentCore SDK fornece dois executores de conjuntos de dados que compartilham o mesmo esquema de conjunto de dados e formato de verdade básica, mas diferem no local onde a avaliação acontece:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) — coleta extensões e chama a API Evaluate do lado do cliente. Ideal para iteração em tempo de desenvolvimento e pequenos conjuntos de dados.

  • Batch dataset runner (BatchEvaluationRunner) — Delega a coleta e a avaliação de abrangências ao serviço por meio da API de avaliação em lote. Ideal para grandes conjuntos de dados e linhas de base de produção.

Escolhendo um corredor

Aspecto On-demand corredor Executor de lotes

Coleção Span

SDK-side via AgentSpanCollector

Server-side; o serviço lê CloudWatch diretamente

Avalie as chamadas de API

Chamadas de SDK evaluate() por avaliador e por cenário

O SDK chama startBatchEvaluation() uma vez

Modelo de execução

Tubulação trifásica síncrona (invocar, esperar, avaliar)

Pipeline assíncrono de quatro fases (invocar, esperar, enviar, pesquisar)

Resultados

Estruturado EvaluationResult com detalhes por cenário e por avaliador

Agregue BatchEvaluationSummary com médias por avaliador, além de detalhes por sessão em CloudWatch

Melhor para

Dev-time iteração CI/CD, pequenos conjuntos de dados, quando você precisa imediatamente de detalhes por cenário

Medição da linha de base, grandes conjuntos de dados, pre/post comparação, quando as pontuações agregadas são suficientes

Pré-requisitos

Ambos os corredores exigem:

  • Python 3.10 ou superior

  • Um agente criado com uma estrutura compatível e uma biblioteca de instrumentação. Para obter mais informações sobre estruturas compatíveis e bibliotecas de instrumentação, consulte Estruturas de agentes suportadas.

  • Um agente implantado no AgentCore Runtime com a observabilidade ativada ou um agente criado com uma estrutura compatível configurada com o AgentCore Observability, incluindo a Pesquisa de Transações. Para obter mais informações sobre a configuração de telemetria, consulte Configuração e entrega de telemetria.

  • O AgentCore SDK instalado: pip install bedrock-agentcore

  • AWS credenciais configuradas com permissões parabedrock-agentcore,bedrock-agentcore-control, e logs () CloudWatch