As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Terminologia de avaliação
Compreender os principais conceitos e terminologia é essencial para o uso eficaz AgentCore das avaliações. Os termos a seguir definem os principais componentes e processos envolvidos na avaliação do agente.
Tópicos
Estrutura de agentes
Uma estrutura de agentes fornece os componentes fundamentais para criar, orquestrar e executar aplicativos baseados em agentes. As estruturas definem estruturas como etapas, ferramentas, fluxo de controle e gerenciamento de memória. As estruturas comuns do setor incluem agentes Strands
Para obter mais informações sobre estruturas compatíveis, consulte Estruturas de agentes suportadas.
Biblioteca de instrumentação
Uma biblioteca de instrumentação registra a telemetria gerada pelo seu agente durante a execução. Essa telemetria pode incluir rastreamentos, extensões, chamadas de ferramentas, invocações de modelos e etapas intermediárias. Bibliotecas como OpenTelemetry e OpenInference oferecem APIs padronizadas e convenções semânticas que permitem capturar o comportamento do agente com o mínimo de alterações no código. A instrumentação é necessária para coleta e avaliação de traços.
Para obter mais informações sobre bibliotecas de instrumentação suportadas, consulte Estruturas de agentes suportadas.
Agente de instrumentação
Um agente de instrumentação captura automaticamente a telemetria do código do aplicativo, a processa e a exporta para um serviço de back-end para armazenamento ou avaliação. Ferramentas como o ADOT (AWS Distro for OpenTelemetry) fornecem um agente de instrumentação automática independente do fornecedor e pronto para produção que injeta dinamicamente bytecode para capturar rastreamentos sem alterações no código. O agente é um componente essencial para permitir a avaliação automatizada.
AgentCore Atualmente, as avaliações suportam o ADOT (AWS Distro for OpenTelemetry) como agente de instrumentação.
Sessão
Uma sessão representa um agrupamento lógico de interações relacionadas de um único usuário ou fluxo de trabalho. Uma sessão pode conter um ou mais rastreamentos. As sessões ajudam você a visualizar e avaliar o comportamento do agente em interações de várias etapas, em vez de se concentrar em solicitações individuais.
Rastrear
Um rastro é um registro completo de uma única execução ou solicitação de agente. Um rastreamento contém uma ou mais extensões, que representam as operações individuais realizadas durante essa execução. Os rastreamentos fornecem visibilidade de ponta a ponta das decisões dos agentes e do uso de ferramentas.
Chamada de ferramenta
Uma chamada de ferramenta é um intervalo que representa a invocação de uma função, API ou recurso externo por um agente. Os períodos de chamada de ferramentas normalmente capturam informações como nome da ferramenta, parâmetros de entrada, tempo de execução e saída. Os detalhes da chamada da ferramenta são usados para avaliar se o agente selecionou e usou as ferramentas de forma correta e eficiente.
Habilidade
Uma habilidade é um arquivo de instrução reutilizável que um agente carrega em tempo de execução para ajudar em uma tarefa. As habilidades seguem o padrão aberto SKILL.md arquivo diretamente do sistema de arquivos. AgentCore As avaliações detectam invocações de habilidades a partir dos rastros de um agente. Para avaliá-los, use os avaliadores de habilidades integrados ou os avaliadores TOOL_CALL personalizados que fazem referência aos espaços reservados para habilidades. Criar avaliador
Consulte modelos de linguagem grande (LLMs) gratuitos como juízes
Grandes modelos de linguagem (LLMs) como juízes se referem a um método de avaliação que usa um modelo de linguagem grande (LLM) para avaliar automaticamente a qualidade, exatidão ou eficácia da saída de um agente ou de outro modelo. Em vez de confiar na revisão manual ou em verificações baseadas em regras, o LLM recebe critérios de avaliação e produz uma pontuação, rótulo ou explicação com base na entrada e na saída que estão sendo avaliadas. Ao contrário das avaliações tradicionais que se baseiam em dados reais, os LLM-as-a-judge métodos dependem do conhecimento interno do modelo para fazer julgamentos. Essa abordagem permite avaliações qualitativas escaláveis, consistentes e personalizáveis, como correção, qualidade do raciocínio ou adesão às instruções, em um grande número de interações com agentes ou respostas do modelo.