Terminologia de avaliação
Compreender os principais conceitos e terminologias é essencial para o uso eficaz AgentCore das avaliações. Os termos a seguir definem os principais componentes e processos envolvidos na avaliação do agente.
Tópicos
Estrutura do agente
Uma estrutura de agente fornece os componentes básicos para criar, orquestrar e executar aplicativos baseados em agentes. As estruturas definem estruturas como etapas, ferramentas, fluxo de controle e gerenciamento de memória. As estruturas comuns da indústria incluem Strands Agents
AgentCore Atualmente, as avaliações oferecem suporte a Strands Agents e estruturas de LangGraphagentes.
Biblioteca de instrumentação
Uma biblioteca de instrumentação registra a telemetria gerada pelo seu agente durante a execução. Essa telemetria pode incluir rastreamentos, extensões, chamadas de ferramentas, invocações de modelos e etapas intermediárias. Bibliotecas como a OpenTelemetrye OpenInferenceoferecem APIs padronizadas e convenções semânticas que permitem capturar o comportamento do agente com o mínimo de alterações no código. A instrumentação é necessária para coleta e avaliação de traços.
AgentCore As avaliações atualmente suportam OpenTelemetrye OpenInferencecomo bibliotecas de instrumentação.
Agente de instrumentação
Um agente de instrumentação captura automaticamente a telemetria do código do aplicativo, a processa e a exporta para um serviço de back-end para armazenamento ou avaliação. Ferramentas como o ADOT (AWS Distro for OpenTelemetry) fornecem um agente de instrumentação automática, independente do fornecedor e pronto para a produção, que injeta dinamicamente o bytecode para capturar rastreamentos sem alterações no código. O agente é um componente essencial para permitir a avaliação automatizada.
AgentCore Atualmente, as avaliações oferecem suporte ao ADOT (AWS Distro for OpenTelemetry) como agente de instrumentação.
Sessão
Uma sessão representa um agrupamento lógico de interações relacionadas de um único usuário ou fluxo de trabalho. Uma sessão pode conter um ou mais rastreamentos. As sessões ajudam você a visualizar e avaliar o comportamento do agente em interações de várias etapas, em vez de se concentrar em solicitações individuais.
Traço
Um rastro é um registro completo de uma única execução ou solicitação de agente. Um rastreamento contém uma ou mais extensões, que representam as operações individuais realizadas durante essa execução. Os rastreamentos fornecem visibilidade de ponta a ponta das decisões dos agentes e do uso de ferramentas.
Chamada de ferramenta
Uma chamada de ferramenta é um intervalo que representa a invocação de uma função, API ou recurso externo por um agente. Os períodos de chamada de ferramentas normalmente capturam informações como nome da ferramenta, parâmetros de entrada, tempo de execução e saída. Os detalhes da chamada de ferramenta são usados para avaliar se o agente selecionou e usou as ferramentas de forma correta e eficiente.
Faça referência a modelos gratuitos de linguagem grande (LLMs) como juízes
Os modelos de linguagem grande (LLMs), como juízes, referem-se a um método de avaliação que usa um modelo de linguagem grande (LLM) para avaliar automaticamente a qualidade, exatidão ou eficácia de um agente ou da saída de outro modelo. Em vez de depender de revisão manual ou verificações baseadas em regras, o LLM é solicitado com critérios de avaliação e produz uma pontuação, rótulo ou explicação com base na entrada e na saída que estão sendo avaliadas. Diferentemente das avaliações tradicionais que se baseiam em dados reais, os LLM-as-a-judge métodos dependem do conhecimento interno do modelo para fazer julgamentos. Essa abordagem permite avaliações qualitativas escaláveis, consistentes e personalizáveis, como exatidão, qualidade do raciocínio ou adesão às instruções, em um grande número de interações de agentes ou respostas de modelos.