Terminologie der Bewertung
Das Verständnis der wichtigsten Konzepte und der Terminologie ist für die effektive Nutzung von AgentCore Evaluationen unerlässlich. Die folgenden Begriffe definieren die Kernkomponenten und Prozesse, die bei der Bewertung von Mitarbeitern erforderlich sind.
Themen
Agenten-Framework
Ein Agent-Framework stellt die grundlegenden Komponenten für die Erstellung, Orchestrierung und Ausführung agentenbasierter Anwendungen bereit. Frameworks definieren Strukturen wie Schritte, Tools, Kontrollfluss und Speicherverwaltung. Zu den gängigen Branchen-Frameworks gehören Strands Agents LangGraph
AgentCore Evaluations unterstützt derzeit Strands Agents und LangGraphAgent-Frameworks.
Instrumentierungsbibliothek
Eine Instrumentierungsbibliothek zeichnet die von Ihrem Agenten während der Ausführung generierte Telemetrie auf. Diese Telemetrie kann Traces, Spans, Tool-Aufrufe, Modellaufrufe und Zwischenschritte umfassen. Bibliotheken wie OpenTelemetryund OpenInferencebieten standardisierte APIs und semantische Konventionen, mit denen Sie das Verhalten von Agenten mit minimalen Codeänderungen erfassen können. Für die Erfassung und Auswertung von Traces ist eine Instrumentierung erforderlich.
AgentCore Evaluationen unterstützt derzeit OpenTelemetryund OpenInferenceals Instrumentierungsbibliotheken.
Instrumentierungsagent
Ein Instrumentierungsagent erfasst automatisch Telemetrie aus dem Anwendungscode, verarbeitet sie und exportiert sie zur Speicherung oder Auswertung an einen Backend-Service. Tools wie ADOT (AWS Distro for OpenTelemetry) bieten einen herstellerneutralen, produktionsbereiten Agenten für automatische Instrumentierung, der dynamisch Bytecode einfügt, um Spuren ohne Codeänderungen zu erfassen. Der Agent ist eine Schlüsselkomponente für die automatisierte Auswertung.
AgentCore Evaluations unterstützt derzeit ADOT (AWS Distro for OpenTelemetry) als Instrumentierungsagent.
Sitzung
Eine Sitzung stellt eine logische Gruppierung verwandter Interaktionen eines einzelnen Benutzers oder Workflows dar. Eine Sitzung kann eine oder mehrere Traces enthalten. Mithilfe von Sitzungen können Sie das Verhalten von Agenten in mehrstufigen Interaktionen betrachten und bewerten, anstatt sich auf einzelne Anfragen zu konzentrieren.
Trace
Ein Trace ist eine vollständige Aufzeichnung der Ausführung oder Anfrage eines einzelnen Agenten. Eine Ablaufverfolgung enthält einen oder mehrere Bereiche, die die einzelnen Operationen darstellen, die während dieser Ausführung ausgeführt wurden. Traces bieten einen umfassenden Überblick über die Entscheidungen der Agenten und die Nutzung der Tools.
Tool Call
Ein Toolaufruf ist ein Bereich, der den Aufruf einer externen Funktion, API oder Fähigkeit durch einen Agenten darstellt. Bei einem Werkzeugaufruf werden in der Regel Informationen wie der Name des Tools, die Eingabeparameter, die Ausführungszeit und die Ausgabe erfasst. Anhand der Details der Tool-Aufrufe wird bewertet, ob der Agent Tools korrekt und effizient ausgewählt und verwendet hat.
Nutzen Sie Free Large Language Models (LLMs) als Richter
Large Language Models (LLMs) als Richter bezieht sich auf eine Bewertungsmethode, bei der anhand eines großen Sprachmodells (LLM) automatisch die Qualität, Richtigkeit oder Effektivität der Ergebnisse eines Agenten oder eines anderen Modells bewertet wird. Anstatt sich auf eine manuelle Überprüfung oder regelbasierte Prüfungen zu verlassen, wird der LLM nach Bewertungskriterien gefragt und erstellt auf der Grundlage der zu bewertenden Eingaben und Ergebnisse eine Bewertung, eine Bewertung oder eine Erklärung. Im Gegensatz zu herkömmlichen Bewertungen, die sich auf Basisdaten stützen, stützen sich LLM-as-a-judge Methoden auf das interne Wissen des Modells, um Urteile zu fällen. Dieser Ansatz ermöglicht skalierbare, konsistente und anpassbare qualitative Bewertungen, z. B. in Bezug auf Richtigkeit, Argumentationsqualität oder Einhaltung von Anweisungen, bei einer großen Anzahl von Interaktionen mit Agenten oder Modellantworten.