View a markdown version of this page

예측기 - Amazon Bedrock AgentCore

기계 번역으로 제공되는 번역입니다. 제공된 번역과 원본 영어의 내용이 상충하는 경우에는 영어 버전이 우선합니다.

예측기

평가자는 다양한 차원에서 에이전트의 성능을 평가하는 핵심 구성 요소입니다. 에이전트 추적을 분석하고 유용성, 정확성 또는 사용자 지정 비즈니스 지표와 같은 특정 기준에 따라 정량적 점수를 제공합니다. AgentCore Evaluations는 일반적인 사용 사례에 대한 기본 제공 평가자와 오픈 소스 평가 라이브러리의 타사 평가자를 제공합니다. 특정 요구 사항에 맞는 사용자 지정 평가자를 생성할 수도 있습니다.

기본 제공 평가자

내장 평가자는 대형 언어 모델(LLMs)을 판사로 사용하여 에이전트 성능을 평가하는 사전 구성된 솔루션입니다. 이러한 평가자는 신중하게 만든 프롬프트 템플릿, 선택한 평가자 모델, 표준화된 점수 기준 등 사전 정의된 구성과 함께 제공됩니다.

기본 제공 평가자는 평가 전반에 걸쳐 일관성과 신뢰성을 보장하면서 일반적인 평가 요구 사항을 해결하도록 설계되었습니다. 이는 완전 관리형 상품의 일부이므로 추가 구성 없이 즉시 사용할 수 있으며 시간이 지남에 따라 품질을 개선하고 새 평가자를 추가할 예정입니다. 일관성과 신뢰성을 유지하기 위해 기본 제공 평가자의 구성을 수정할 수 없습니다.

타사 평가자

타사 평가자는 DeepEval 및 AutoEval 오픈 소스 라이브러리에서 가져옵니다. Amazon Bedrock AgentCore는 기본 제공 평가자와 동일한 방식으로 이를 관리합니다. ID별로 타사 평가자를 선택하면 서비스가 이를 실행하므로 모델이나 구성이 필요하지 않습니다. 기본 제공 또는 타사 평가자로부터 사용자 지정 평가자를 도출하여 자체 모델에서 로직을 실행할 수도 있습니다. 자세한 내용은 타사 평가자를 참조하세요.

사용자 지정 평가자

사용자 지정 평가자는 평가 프로세스의 모든 측면을 정의할 수 있도록 하여 더 많은 유연성을 제공합니다. AgentCore 평가는 다음과 같은 유형의 사용자 지정 평가자를 지원합니다.

  • LLM-as-a-judge 평가자 - 자체 평가자 모델, 평가 지침 및 점수 평가 스키마를 정의합니다. 평가자 모델을 선택하고, 사용자 지정 평가 지침을 작성하고, 특정 평가 기준을 정의하고, 자체 점수 평가 스키마를 설계하여 특정 요구 사항에 맞게 평가를 조정할 수 있습니다. 자세한 내용은 사용자 지정 평가자를 참조하세요.

  • 코드 기반 평가자 - 자체 AWS Lambda 함수를 사용하여 에이전트 성능을 프로그래밍 방식으로 평가합니다. 이 접근 방식을 사용하면 평가 로직을 완벽하게 제어할 수 있으므로 LLM 판단자에 의존하지 않고도 결정론적 검사, 외부 API 호출, 정규식 일치, 사용자 지정 지표 또는 비즈니스별 규칙을 사용할 수 있습니다. 자세한 내용은 사용자 지정 코드 기반 평가자를 참조하세요.

  • 기본 평가자에서 파생된 평가자 - 서비스가 선택하는 모델 대신 자체 모델 및 추론에서 기존 내장 또는 타사 평가자의 로직을 실행합니다. 자세한 내용은 타사 평가자를 참조하세요.

이러한 수준의 사용자 지정은 도메인별 에이전트를 평가하거나, 고유한 품질 표준을 적용하거나, 특수 채점 시스템을 구현해야 할 때 특히 유용합니다. 예를 들어 의료 또는 재무와 같은 특정 산업에 대한 사용자 지정 평가 기준을 생성하거나 조직의 품질 지표에 맞는 점수 평가 스키마를 설계할 수 있습니다.