Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Valutazione di set di dati
Nota
La valutazione del set di dati è in anteprima pubblica. Le funzionalità e le API possono cambiare prima della disponibilità generale.
Le valutazioni dei set di dati consentono di eseguire l'agente in base a una serie di scenari e di valutare automaticamente i risultati. Invece di invocare manualmente l'agente, raccogliere gli intervalli e chiamare l'API Evaluate, un dataset runner orchestra l'intero ciclo di vita in un'unica chiamata: richiama l'agente, attende l'inserimento della telemetria e valuta.
Ciò è utile per i test di regressione, i set di dati di benchmark, le pipeline, la misurazione della linea di base e il confronto dopo le modifiche alla configurazione. CI/CD pre/post
L' AgentCore SDK fornisce due gestori di set di dati che condividono lo stesso schema del set di dati e lo stesso formato di base, ma differiscono nel luogo in cui avviene la valutazione:
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner): raccoglie gli intervalli e chiama l'API Evaluate sul lato client. Ideale per iterazioni in fase di sviluppo e set di dati di piccole dimensioni. -
Batch dataset runner (
BatchEvaluationRunner): delega la raccolta e la valutazione degli intervalli al servizio tramite l'API di valutazione in batch. Ideale per set di dati di grandi dimensioni e linee di base di produzione.
Scegliere un corridore
| Aspetto | On-demand corridore | Batch Runner |
|---|---|---|
|
Collezione Span |
SDK-side tramite |
Server-side; il servizio legge CloudWatch direttamente da |
|
Valuta le chiamate API |
Chiamate SDK |
L'SDK chiama una volta |
|
Modello di esecuzione |
Pipeline sincrona trifase (richiamo, attesa, valutazione) |
Pipeline asincrona a quattro fasi (invoke, wait, submit, poll) |
|
Risultati |
|
Aggregato |
|
Ideale per |
Dev-time iterazione, piccoli set di dati CI/CD, quando hai bisogno immediatamente di dettagli per scenario |
misurazione di base, set di dati di grandi dimensioni, pre/post confronto, quando i punteggi aggregati sono sufficienti |
Prerequisiti
Entrambi i corridori richiedono:
-
Python 3.10+
-
Un agente creato con un framework e una libreria di strumentazione supportati. Per ulteriori informazioni sui framework e sulle librerie di strumentazione supportati, vedere Frameworks per agenti supportati. Framework per agenti supportati
-
Un agente distribuito su AgentCore Runtime con l'osservabilità abilitata o un agente creato con un framework supportato configurato con Observability, inclusa Transaction Search. AgentCore Per ulteriori informazioni sulla configurazione della telemetria, vedere Configurazione e consegna della telemetria. Configurazione e consegna della telemetria
-
L' AgentCore SDK installato:
pip install bedrock-agentcore -
AWS credenziali configurate con le autorizzazioni per
bedrock-agentcorebedrock-agentcore-control, e ()logsCloudWatch