View a markdown version of this page

Terminologie de l'évaluation - Base rocheuse de l'Amazonie AgentCore

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Terminologie de l'évaluation

Il est essentiel de comprendre les concepts et la terminologie clés pour utiliser efficacement AgentCore les évaluations. Les termes suivants définissent les principaux composants et processus impliqués dans l'évaluation des agents.

Framework d'agents

Un framework d'agents fournit les composants de base nécessaires à la création, à l'orchestration et à l'exécution d'applications basées sur des agents. Les frameworks définissent des structures telles que les étapes, les outils, le flux de contrôle et la gestion de la mémoire. Les cadres industriels courants incluent les agents Strands sur le site Web de Strands et LangGraph. Ces cadres permettent de normaliser la façon dont les agents sont construits et facilitent leur instrumentation et leur évaluation.

Pour plus d'informations sur les frameworks pris en charge, consultez Frameworks d'agents pris en charge.

Bibliothèque d'instrumentation

Une bibliothèque d'instrumentation enregistre la télémétrie générée par votre agent lors de son exécution. Cette télémétrie peut inclure des traces, des étendues, des appels d'outils, des appels de modèles et des étapes intermédiaires. Les bibliothèques telles que OpenTelemetry et OpenInference proposent des API standardisées et des conventions sémantiques qui vous permettent de capturer le comportement des agents avec un minimum de modifications de code. L'instrumentation est requise pour la collecte et l'évaluation des traces.

Pour plus d'informations sur les bibliothèques d'instrumentation prises en charge, consultez la section Frameworks d'agents pris en charge.

Agent d'instrumentation

Un agent d'instrumentation capture automatiquement la télémétrie à partir du code de l'application, la traite et l'exporte vers un service principal à des fins de stockage ou d'évaluation. Des outils tels que ADOT (AWS Distro for OpenTelemetry) fournissent un agent d'auto-instrumentation prêt à être utilisé en production et indépendant des fournisseurs, qui injecte dynamiquement du bytecode pour capturer les traces sans modifier le code. L'agent joue un rôle clé dans la mise en place d'une évaluation automatique.

AgentCore Evaluations prend actuellement en charge ADOT (AWS Distro for OpenTelemetry) en tant qu'agent d'instrumentation.

Session

Une session représente un regroupement logique d'interactions connexes provenant d'un seul utilisateur ou d'un seul flux de travail. Une session peut contenir une ou plusieurs traces. Les sessions vous permettent de visualiser et d'évaluer le comportement des agents lors d'interactions en plusieurs étapes, plutôt que de vous concentrer sur des demandes individuelles.

Suivi

Une trace est un enregistrement complet de l'exécution ou de la demande d'un seul agent. Une trace contient une ou plusieurs plages, qui représentent les opérations individuelles effectuées au cours de cette exécution. Les traces fournissent une visibilité de bout en bout sur les décisions des agents et l'utilisation des outils.

Appel d'outils

Un appel d'outil est une plage qui représente l'invocation par un agent d'une fonction, d'une API ou d'une capacité externe. Les intervalles d'appels d'outils capturent généralement des informations telles que le nom de l'outil, les paramètres d'entrée, le temps d'exécution et la sortie. Les détails des appels d'outils sont utilisés pour évaluer si l'agent a sélectionné et utilisé les outils correctement et efficacement.

Compétence

Une compétence est un fichier d'instructions réutilisable qu'un agent charge au moment de l'exécution pour faciliter une tâche. Les compétences suivent la norme ouverte Agent Skills pour la structure des fichiers de compétences. Au moment de l'exécution, l'agent sélectionne une compétence dans le catalogue qui lui a été présenté ou lit le SKILL.md fichier directement depuis le système de fichiers. AgentCore Les évaluations détectent les invocations de compétences à partir des traces d'un agent. Pour les évaluer, utilisez les évaluateurs de compétences intégrés ou les évaluateurs TOOL_CALL personnalisés qui font référence aux espaces réservés aux compétences. Créer un évaluateur

Référez-vous à des modèles de langage large (LLM) gratuits en tant que juges

Les grands modèles linguistiques (LLM) en tant que juges font référence à une méthode d'évaluation qui utilise un grand modèle linguistique (LLM) pour évaluer automatiquement la qualité, l'exactitude ou l'efficacité des résultats d'un agent ou d'un autre modèle. Au lieu de s'appuyer sur une révision manuelle ou des vérifications basées sur des règles, le LLM est invité à indiquer des critères d'évaluation et produit un score, une étiquette ou une explication en fonction des entrées et des sorties évaluées. Contrairement aux évaluations traditionnelles qui s'appuient sur des données factuelles, LLM-as-a-judge les méthodes s'appuient sur les connaissances internes du modèle pour porter des jugements. Cette approche permet des évaluations qualitatives évolutives, cohérentes et personnalisables, telles que l'exactitude, la qualité du raisonnement ou le respect des instructions, sur un grand nombre d'interactions entre agents ou de réponses de modèles.