View a markdown version of this page

Évaluateurs - Amazon Bedrock AgentCore

Évaluateurs

Les évaluateurs sont les éléments essentiels qui évaluent les performances de votre agent sous différents angles. Ils analysent les traces des agents et fournissent des scores quantitatifs basés sur des critères spécifiques tels que l'utilité, la précision ou des indicateurs commerciaux personnalisés. AgentCore Evaluations propose à la fois des évaluateurs intégrés pour les cas d'utilisation courants et la flexibilité nécessaire pour créer des évaluateurs personnalisés adaptés à vos besoins spécifiques.

Built-in évaluateurs

Built-in les évaluateurs sont des solutions préconfigurées qui utilisent les grands modèles linguistiques (LLM) comme juges pour évaluer les performances des agents. Ces évaluateurs sont fournis avec des configurations prédéfinies, notamment des modèles d'invite soigneusement conçus, des modèles d'évaluateurs sélectionnés et des critères de notation standardisés.

Built-in les évaluateurs sont conçus pour répondre à des besoins d'évaluation communs tout en garantissant la cohérence et la fiabilité des évaluations. Comme ils font partie de notre offre entièrement gérée, vous pouvez les utiliser immédiatement sans aucune configuration supplémentaire. Nous continuerons à améliorer leur qualité et à ajouter de nouveaux évaluateurs au fil du temps. Pour préserver la cohérence et la fiabilité, les configurations des évaluateurs intégrés ne peuvent pas être modifiées.

Évaluateurs personnalisés

Les évaluateurs personnalisés offrent plus de flexibilité en vous permettant de définir tous les aspects de votre processus d'évaluation. AgentCore Evaluations prend en charge deux types d'évaluateurs personnalisés :

  • LLM-as-a-judge évaluateurs — Définissez votre propre modèle d'évaluateur, vos instructions d'évaluation et vos propres schémas de notation. Vous pouvez adapter l'évaluation à vos besoins spécifiques en sélectionnant le modèle d'évaluateur, en élaborant des instructions d'évaluation personnalisées, en définissant des critères d'évaluation spécifiques et en concevant votre propre schéma de notation. Pour plus d'informations, consultez la section Évaluateurs personnalisés.

  • Code-based évaluateurs — Utilisez votre propre fonction AWS Lambda pour évaluer les performances des agents de manière programmatique. Cette approche vous donne un contrôle total sur la logique d'évaluation, en activant les contrôles déterministes, les appels d'API externes, le matching de regex, les métriques personnalisées ou toute autre règle spécifique à l'entreprise sans vous fier à un juge LLM. Pour plus d'informations, consultez la section Evaluateur personnalisé basé sur du code.

Ce niveau de personnalisation est particulièrement utile lorsque vous devez évaluer des agents spécifiques à un domaine, appliquer des normes de qualité uniques ou mettre en œuvre des systèmes de notation spécialisés. Par exemple, vous pouvez créer des critères d'évaluation personnalisés pour des secteurs spécifiques tels que la santé ou la finance, ou concevoir des schémas de notation conformes aux indicateurs de qualité de votre organisation.