View a markdown version of this page

Auswertungsprogramme - Amazon Grundgestein AgentCore

Auswertungsprogramme

Evaluatoren sind die Kernkomponenten, mit denen die Leistung Ihres Agenten in verschiedenen Dimensionen bewertet wird. Sie analysieren die Spuren von Agenten und liefern quantitative Bewertungen, die auf bestimmten Kriterien wie Hilfsbereitschaft, Genauigkeit oder individuellen Geschäftskennzahlen basieren. AgentCore Evaluations bietet sowohl integrierte Evaluatoren für gängige Anwendungsfälle als auch die Flexibilität, benutzerdefinierte Evaluatoren zu erstellen, die auf Ihre spezifischen Anforderungen zugeschnitten sind.

Built-in Evaluatoren

Built-in Evaluatoren sind vorkonfigurierte Lösungen, die Large Language Models (LLMs) als Richter zur Bewertung der Leistung von Mitarbeitern verwenden. Diese Evaluatoren verfügen über vordefinierte Konfigurationen, darunter sorgfältig ausgearbeitete Vorlagen für Eingabeaufforderungen, ausgewählte Evaluatormodelle und standardisierte Bewertungskriterien.

Built-in Die Evaluatoren sind so konzipiert, dass sie allgemeinen Evaluierungsanforderungen gerecht werden und gleichzeitig die Konsistenz und Zuverlässigkeit aller Bewertungen sicherstellen. Da sie Teil unseres vollständig verwalteten Angebots sind, können Sie sie sofort und ohne zusätzliche Konfiguration verwenden. Wir werden ihre Qualität weiter verbessern und im Laufe der Zeit neue Gutachter hinzufügen. Um Konsistenz und Zuverlässigkeit zu gewährleisten, können die Konfigurationen der integrierten Evaluatoren nicht geändert werden.

Benutzerdefinierte Evaluatoren

Benutzerdefinierte Evaluatoren bieten mehr Flexibilität, da Sie alle Aspekte Ihres Bewertungsprozesses definieren können. AgentCore Evaluations unterstützt zwei Arten von benutzerdefinierten Evaluatoren:

  • LLM-as-a-judge Evaluatoren — Definieren Sie Ihr eigenes Evaluatormodell, Ihre eigenen Bewertungsanweisungen und Bewertungsschemata. Sie können die Bewertung an Ihre spezifischen Bedürfnisse anpassen, indem Sie das Evaluatormodell auswählen, benutzerdefinierte Bewertungsanweisungen erstellen, spezifische Bewertungskriterien definieren und Ihr eigenes Bewertungsschema entwerfen. Weitere Informationen finden Sie unter Benutzerdefinierte Evaluatoren.

  • Code-based Evaluatoren — Verwenden Sie Ihre eigene AWS Lambda-Funktion, um die Agentenleistung programmgesteuert zu bewerten. Dieser Ansatz gibt Ihnen die volle Kontrolle über die Bewertungslogik und ermöglicht deterministische Prüfungen, externe API-Aufrufe, Regex-Abgleich, benutzerdefinierte Metriken oder andere geschäftsspezifische Regeln, ohne sich auf einen LLM-Richter verlassen zu müssen. Weitere Informationen finden Sie unter Benutzerdefinierter codebasierter Evaluator.

Dieser Grad der Anpassung ist besonders nützlich, wenn Sie domänenspezifische Agenten evaluieren, einzigartige Qualitätsstandards anwenden oder spezielle Bewertungssysteme implementieren müssen. Sie können beispielsweise benutzerdefinierte Bewertungskriterien für bestimmte Branchen wie das Gesundheitswesen oder das Finanzwesen erstellen oder Bewertungsschemata entwerfen, die sich an den Qualitätskennzahlen Ihres Unternehmens orientieren.