예측기
평가자는 다양한 차원에서 에이전트의 성능을 평가하는 핵심 구성 요소입니다. 에이전트 추적을 분석하고 유용성, 정확성 또는 사용자 지정 비즈니스 지표와 같은 특정 기준에 따라 정량적 점수를 제공합니다. AgentCore Evaluations는 일반적인 사용 사례에 대한 기본 제공 평가자와 특정 요구 사항에 맞는 사용자 지정 평가자를 생성할 수 있는 유연성을 모두 제공합니다.
기본 제공 평가자
내장 평가자는 대형 언어 모델(LLMs)을 판사로 사용하여 에이전트 성능을 평가하는 사전 구성된 솔루션입니다. 이러한 평가자는 신중하게 만든 프롬프트 템플릿, 선택한 평가자 모델, 표준화된 점수 기준 등 사전 정의된 구성과 함께 제공됩니다.
기본 제공 평가자는 평가 전반에 걸쳐 일관성과 신뢰성을 보장하면서 일반적인 평가 요구 사항을 해결하도록 설계되었습니다. 이는 완전 관리형 상품의 일부이므로 추가 구성 없이 즉시 사용할 수 있으며 시간이 지남에 따라 품질을 개선하고 새 평가자를 추가할 예정입니다. 일관성과 신뢰성을 유지하기 위해 기본 제공 평가자의 구성을 수정할 수 없습니다.
사용자 지정 평가자
사용자 지정 평가자는 평가 프로세스의 모든 측면을 정의할 수 있도록 하여 더 많은 유연성을 제공합니다. AgentCore 평가는 두 가지 유형의 사용자 지정 평가자를 지원합니다.
-
LLM-as-a-judge 평가자 - 자체 평가자 모델, 평가 지침 및 점수 평가 스키마를 정의합니다. 평가자 모델을 선택하고, 사용자 지정 평가 지침을 작성하고, 특정 평가 기준을 정의하고, 자체 점수 평가 스키마를 설계하여 특정 요구 사항에 맞게 평가를 조정할 수 있습니다. 자세한 내용은 사용자 지정 평가자를 참조하세요.
-
코드 기반 평가자 - 자체 AWS Lambda 함수를 사용하여 에이전트 성능을 프로그래밍 방식으로 평가합니다. 이 접근 방식을 사용하면 평가 로직을 완벽하게 제어할 수 있으므로 LLM 판단자에 의존하지 않고도 결정론적 검사, 외부 API 호출, 정규식 일치, 사용자 지정 지표 또는 비즈니스별 규칙을 사용할 수 있습니다. 자세한 내용은 사용자 지정 코드 기반 평가자를 참조하세요.
이러한 수준의 사용자 지정은 도메인별 에이전트를 평가하거나, 고유한 품질 표준을 적용하거나, 특수 채점 시스템을 구현해야 할 때 특히 유용합니다. 예를 들어 의료 또는 재무와 같은 특정 산업에 대한 사용자 지정 평가 기준을 생성하거나 조직의 품질 지표에 맞는 점수 평가 스키마를 설계할 수 있습니다.