Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.
Évaluation d’un jeu de données
Note
L'évaluation de l'ensemble de données est en avant-première publique. Les fonctionnalités et les API peuvent changer avant la disponibilité générale.
Les évaluations des ensembles de données vous permettent d'exécuter votre agent en fonction d'un ensemble de scénarios et d'évaluer automatiquement les résultats. Au lieu d'appeler manuellement votre agent, de collecter des spans et d'appeler l'API Evaluate, un gestionnaire de données orchestre l'intégralité du cycle de vie en un seul appel : invoquez l'agent, attendez l'ingestion de données télémétriques et évaluez.
Ceci est utile pour les tests de régression, les ensembles de données de référence, les CI/CD pipelines, les mesures de référence et les pre/post comparaisons après des modifications de configuration.
Le AgentCore SDK fournit deux moteurs de jeu de données qui partagent le même schéma de jeu de données et le même format de base de données, mais qui diffèrent quant à l'endroit où l'évaluation a lieu :
-
On-demand dataset runner (
OnDemandEvaluationDatasetRunner) : collecte les spans et appelle l'API Evaluate côté client. Idéal pour les itérations au moment du développement et les petits ensembles de données. -
Batch dataset runner (
BatchEvaluationRunner) : les délégués assurent la collecte et l'évaluation du service via l'API d'évaluation par lots. Idéal pour les grands ensembles de données et les bases de production.
Choisir un coureur
| Aspect | On-demand coureur | Batch Runner |
|---|---|---|
|
Collection Span |
SDK-side via |
Server-side; le service lit CloudWatch directement |
|
Evaluer les appels d'API |
Appels au SDK |
Le SDK appelle |
|
Modèle d'exécution |
Pipeline triphasé synchrone (invoquer, attendre, évaluer) |
Pipeline asynchrone en quatre phases (invoquer, attendre, soumettre, interroger) |
|
Résultats |
Structuré |
Agréger |
|
Idéal pour |
Dev-time itération, petits ensembles de données CI/CD, lorsque vous avez immédiatement besoin de détails par scénario |
Mesure de référence, grands ensembles de données, pre/post comparaison, lorsque les scores agrégés sont suffisants |
Conditions préalables
Les deux coureurs ont besoin de :
-
Python 3.10 et versions ultérieures
-
Un agent créé à l'aide d'un framework et d'une bibliothèque d'instruments pris en charge. Pour plus d'informations sur les frameworks et les bibliothèques d'instrumentation pris en charge, consultez Frameworks d'agents pris en charge.
-
Un agent déployé sur AgentCore Runtime avec l'observabilité activée, ou un agent construit avec un framework pris en charge configuré avec AgentCore Observability, y compris Transaction Search. Pour plus d'informations sur la configuration de la télémétrie, voir Configuration et livraison de la télémétrie.
-
Le AgentCore SDK installé :
pip install bedrock-agentcore -
AWS informations d'identification configurées avec des autorisations pour
bedrock-agentcorebedrock-agentcore-control, etlogs(CloudWatch)