View a markdown version of this page

Valutazione di set di dati - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Valutazione di set di dati

Nota

La valutazione del set di dati è in anteprima pubblica. Le funzionalità e le API possono cambiare prima della disponibilità generale.

Le valutazioni dei set di dati consentono di eseguire l'agente in base a una serie di scenari e di valutare automaticamente i risultati. Invece di invocare manualmente l'agente, raccogliere gli intervalli e chiamare l'API Evaluate, un dataset runner orchestra l'intero ciclo di vita in un'unica chiamata: richiama l'agente, attende l'inserimento della telemetria e valuta.

Ciò è utile per i test di regressione, i set di dati di benchmark, le pipeline, la misurazione della linea di base e il confronto dopo le modifiche alla configurazione. CI/CD pre/post

L' AgentCore SDK fornisce due gestori di set di dati che condividono lo stesso schema del set di dati e lo stesso formato di base, ma differiscono nel luogo in cui avviene la valutazione:

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner): raccoglie gli intervalli e chiama l'API Evaluate sul lato client. Ideale per iterazioni in fase di sviluppo e set di dati di piccole dimensioni.

  • Batch dataset runner (BatchEvaluationRunner): delega la raccolta e la valutazione degli intervalli al servizio tramite l'API di valutazione in batch. Ideale per set di dati di grandi dimensioni e linee di base di produzione.

Scegliere un corridore

Aspetto On-demand corridore Batch Runner

Collezione Span

SDK-side tramite AgentSpanCollector

Server-side; il servizio legge CloudWatch direttamente da

Valuta le chiamate API

Chiamate SDK evaluate() per valutatore per scenario

L'SDK chiama una volta startBatchEvaluation()

Modello di esecuzione

Pipeline sincrona trifase (richiamo, attesa, valutazione)

Pipeline asincrona a quattro fasi (invoke, wait, submit, poll)

Risultati

EvaluationResultStrutturato con dettagli per scenario e per valutatore

Aggregato BatchEvaluationSummary con le medie per valutatore, più i dettagli per sessione in CloudWatch

Ideale per

Dev-time iterazione, piccoli set di dati CI/CD, quando hai bisogno immediatamente di dettagli per scenario

misurazione di base, set di dati di grandi dimensioni, pre/post confronto, quando i punteggi aggregati sono sufficienti

Prerequisiti

Entrambi i corridori richiedono:

  • Python 3.10+

  • Un agente creato con un framework e una libreria di strumentazione supportati. Per ulteriori informazioni sui framework e sulle librerie di strumentazione supportati, vedere Frameworks per agenti supportati. Framework per agenti supportati

  • Un agente distribuito su AgentCore Runtime con l'osservabilità abilitata o un agente creato con un framework supportato configurato con Observability, inclusa Transaction Search. AgentCore Per ulteriori informazioni sulla configurazione della telemetria, vedere Configurazione e consegna della telemetria. Configurazione e consegna della telemetria

  • L' AgentCore SDK installato: pip install bedrock-agentcore

  • AWS credenziali configurate con le autorizzazioni per bedrock-agentcorebedrock-agentcore-control, e () logs CloudWatch