Évaluez les performances des agents avec Amazon Bedrock AgentCore Evaluations
Amazon Bedrock AgentCore Evaluations fournit des outils d'évaluation automatisés pour évaluer dans quelle mesure votre agent ou vos outils exécutent des tâches spécifiques, traitent les cas critiques et assurent la cohérence entre les différentes entrées et contextes. Le service permet une optimisation basée sur les données et garantit que vos agents respectent les normes de qualité avant et après le déploiement.
AgentCore Les évaluations s'intègrent aux frameworks d'agents les plus courants, notamment Strands et LangGraphwith OpenTelemetryet les bibliothèques OpenInferenced'instrumentation. Sous le capot, les traces de ces agents sont converties dans un format unifié et notées à l'aide de LLM-as-a-Judge techniques destinées aux évaluateurs intégrés et personnalisés.
Chaque évaluateur est associé à un Amazon Resource Name (ARN) unique et à une politique de ressources. Les ARN des évaluateurs suivent les formats suivants :
arn:aws:bedrock-agentcore:::evaluator/Builtin.Helpfulness (for built-in evaluators)
arn:aws:bedrock-agentcore:region:account:evaluator/my-evaluator-id (for custom evaluators)
Built-in les évaluateurs sont publics et accessibles à tous les utilisateurs. Les ressources d'évaluation personnalisées sont privées et ne sont accessibles qu'aux utilisateurs autorisés à y accéder de manière explicite. Pour accorder l'accès, vous pouvez utiliser des politiques basées sur les ressources IAM pour les évaluateurs et les configurations d'évaluation, et des politiques basées sur l'identité IAM pour les utilisateurs et les rôles.
Par défaut, vous pouvez créer jusqu'à 1 000 configurations d'évaluation par AWS région dans un AWS compte, avec jusqu'à 100 configurations actives à tout moment. Le service prend en charge jusqu'à 1 million de jetons d'entrée et de sortie par minute et par compte pour les grandes régions.