View a markdown version of this page

Évaluation d’un jeu de données - Base rocheuse de l'Amazonie AgentCore

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Évaluation d’un jeu de données

Note

L'évaluation de l'ensemble de données est en avant-première publique. Les fonctionnalités et les API peuvent changer avant la disponibilité générale.

Les évaluations des ensembles de données vous permettent d'exécuter votre agent en fonction d'un ensemble de scénarios et d'évaluer automatiquement les résultats. Au lieu d'appeler manuellement votre agent, de collecter des spans et d'appeler l'API Evaluate, un gestionnaire de données orchestre l'intégralité du cycle de vie en un seul appel : invoquez l'agent, attendez l'ingestion de données télémétriques et évaluez.

Ceci est utile pour les tests de régression, les ensembles de données de référence, les CI/CD pipelines, les mesures de référence et les pre/post comparaisons après des modifications de configuration.

Le AgentCore SDK fournit deux moteurs de jeu de données qui partagent le même schéma de jeu de données et le même format de base de données, mais qui diffèrent quant à l'endroit où l'évaluation a lieu :

  • On-demand dataset runner (OnDemandEvaluationDatasetRunner) : collecte les spans et appelle l'API Evaluate côté client. Idéal pour les itérations au moment du développement et les petits ensembles de données.

  • Batch dataset runner (BatchEvaluationRunner) : les délégués assurent la collecte et l'évaluation du service via l'API d'évaluation par lots. Idéal pour les grands ensembles de données et les bases de production.

Choisir un coureur

Aspect On-demand coureur Batch Runner

Collection Span

SDK-side via AgentSpanCollector

Server-side; le service lit CloudWatch directement

Evaluer les appels d'API

Appels au SDK evaluate() par évaluateur et par scénario

Le SDK appelle startBatchEvaluation() une fois

Modèle d'exécution

Pipeline triphasé synchrone (invoquer, attendre, évaluer)

Pipeline asynchrone en quatre phases (invoquer, attendre, soumettre, interroger)

Résultats

Structuré EvaluationResult avec des informations détaillées par scénario et par évaluateur

Agréger BatchEvaluationSummary avec les moyennes par évaluateur, plus les détails par session dans CloudWatch

Idéal pour

Dev-time itération, petits ensembles de données CI/CD, lorsque vous avez immédiatement besoin de détails par scénario

Mesure de référence, grands ensembles de données, pre/post comparaison, lorsque les scores agrégés sont suffisants

Conditions préalables

Les deux coureurs ont besoin de :

  • Python 3.10 et versions ultérieures

  • Un agent créé à l'aide d'un framework et d'une bibliothèque d'instruments pris en charge. Pour plus d'informations sur les frameworks et les bibliothèques d'instrumentation pris en charge, consultez Frameworks d'agents pris en charge.

  • Un agent déployé sur AgentCore Runtime avec l'observabilité activée, ou un agent construit avec un framework pris en charge configuré avec AgentCore Observability, y compris Transaction Search. Pour plus d'informations sur la configuration de la télémétrie, voir Configuration et livraison de la télémétrie.

  • Le AgentCore SDK installé : pip install bedrock-agentcore

  • AWS informations d'identification configurées avec des autorisations pour bedrock-agentcorebedrock-agentcore-control, et logs (CloudWatch)