Avaliadores
Os avaliadores são os principais componentes que avaliam o desempenho do seu agente em diferentes dimensões. Eles analisam os rastreamentos dos agentes e fornecem pontuações quantitativas com base em critérios específicos, como utilidade, precisão ou métricas comerciais personalizadas. AgentCore O Evaluations oferece avaliadores integrados para casos de uso comuns e a flexibilidade de criar avaliadores personalizados sob medida para seus requisitos específicos.
Built-in avaliadores
Built-in avaliadores são soluções pré-configuradas que usam Large Language Models (LLMs) como juízes para avaliar o desempenho do agente. Esses avaliadores vêm com configurações predefinidas, incluindo modelos de solicitação cuidadosamente elaborados, modelos de avaliadores selecionados e critérios de pontuação padronizados.
Built-in os avaliadores são projetados para atender às necessidades comuns de avaliação e, ao mesmo tempo, garantir consistência e confiabilidade em todas as avaliações. Como eles fazem parte de nossa oferta totalmente gerenciada, você pode usá-los imediatamente sem nenhuma configuração adicional, e continuaremos melhorando sua qualidade e adicionando novos avaliadores ao longo do tempo. Para preservar a consistência e a confiabilidade, as configurações dos avaliadores integrados não podem ser modificadas.
Avaliadores personalizados
Os avaliadores personalizados oferecem mais flexibilidade, permitindo que você defina todos os aspectos do seu processo de avaliação. AgentCore As avaliações oferecem suporte a dois tipos de avaliadores personalizados:
-
LLM-as-a-judge avaliadores — defina seu próprio modelo de avaliador, instruções de avaliação e esquemas de pontuação. Você pode adaptar a avaliação às suas necessidades específicas selecionando o modelo do avaliador, elaborando instruções de avaliação personalizadas, definindo critérios de avaliação específicos e projetando seu próprio esquema de pontuação. Para obter mais informações, consulte Avaliadores personalizados.
-
Code-based avaliadores — Use sua própria função AWS Lambda para avaliar programaticamente o desempenho do agente. Essa abordagem oferece controle total sobre a lógica de avaliação, permitindo verificações determinísticas, chamadas externas de API, correspondência de regex, métricas personalizadas ou quaisquer regras específicas do negócio sem depender de um juiz de LLM. Para obter mais informações, consulte Avaliador personalizado baseado em código.
Esse nível de personalização é particularmente valioso quando você precisa avaliar agentes específicos do domínio, aplicar padrões de qualidade exclusivos ou implementar sistemas de pontuação especializados. Por exemplo, você pode criar critérios de avaliação personalizados para setores específicos, como saúde ou finanças, ou criar esquemas de pontuação que se alinhem às métricas de qualidade da sua organização.