View a markdown version of this page

Terminologia di valutazione - Fondamento Amazon AgentCore

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Terminologia di valutazione

La comprensione dei concetti e della terminologia chiave è essenziale per utilizzare AgentCore efficacemente le valutazioni. I seguenti termini definiscono i componenti e i processi principali coinvolti nella valutazione degli agenti.

Agent Framework

Un framework per agenti fornisce i componenti fondamentali per la creazione, l'orchestrazione e l'esecuzione di applicazioni basate su agenti. I framework definiscono strutture come passaggi, strumenti, flusso di controllo e gestione della memoria. I framework di settore più comuni includono Strands Agents sul sito Web di Strands e. LangGraph Questi framework aiutano a standardizzare il modo in cui gli agenti sono costruiti e li rendono più facili da strumentare e valutare.

Per ulteriori informazioni sui framework supportati, vedere Framework per agenti supportati. Framework per agenti supportati

Libreria di strumentazione

Una libreria di strumentazione registra la telemetria generata dall'agente durante l'esecuzione. Questa telemetria può includere tracce, intervalli, richiami agli strumenti, richiami ai modelli e passaggi intermedi. Le librerie come OpenTelemetry e OpenInference offrono API standardizzate e convenzioni semantiche che consentono di acquisire il comportamento degli agenti con modifiche minime al codice. La strumentazione è necessaria per la raccolta e la valutazione delle tracce.

Per ulteriori informazioni sulle librerie di strumentazione supportate, vedere Frameworks di agenti supportati.

Instrumentation Agent

Un agente di strumentazione acquisisce automaticamente la telemetria dal codice dell'applicazione, la elabora e la esporta in un servizio di backend per l'archiviazione o la valutazione. Strumenti come ADOT (AWS Distro for OpenTelemetry) forniscono un agente di strumentazione automatica indipendente dal fornitore e pronto per la produzione che inietta dinamicamente bytecode per acquisire tracce senza modifiche al codice. L'agente è un componente chiave per consentire la valutazione automatica.

AgentCore Evaluations attualmente supporta ADOT (AWS Distro for OpenTelemetry) come agente di strumentazione.

Sessione

Una sessione rappresenta un raggruppamento logico di interazioni correlate da un singolo utente o flusso di lavoro. Una sessione può contenere una o più tracce. Le sessioni consentono di visualizzare e valutare il comportamento degli agenti attraverso interazioni in più fasi, anziché concentrarsi sulle singole richieste.

Traccia

Una traccia è una registrazione completa dell'esecuzione o della richiesta di un singolo agente. Una traccia contiene uno o più intervalli, che rappresentano le singole operazioni eseguite durante tale esecuzione. Le tracce forniscono una visibilità completa sulle decisioni degli agenti e sull'utilizzo degli strumenti.

Tool Call

Una chiamata a uno strumento è un intervallo che rappresenta l'invocazione da parte di un agente di una funzione, API o capacità esterna. Gli intervalli di chiamate agli strumenti in genere acquisiscono informazioni come il nome dello strumento, i parametri di input, il tempo di esecuzione e l'output. I dettagli delle chiamate all'utensile vengono utilizzati per valutare se l'agente ha selezionato e utilizzato gli strumenti in modo corretto ed efficiente.

Competenza

Una skill è un file di istruzioni riutilizzabile che un agente carica in fase di esecuzione per facilitare l'esecuzione di un'operazione. Le competenze seguono lo standard aperto Agent Skills per la struttura dei file di abilità. In fase di esecuzione, l'agente seleziona una skill dal catalogo che le è stata mostrata o legge il SKILL.md file direttamente dal filesystem. AgentCore Evaluations rileva le invocazioni di abilità dalle tracce di un agente. Per valutarle, utilizza i valutatori di abilità integrati o i valutatori TOOL_CALL personalizzati che fanno riferimento ai segnaposto delle competenze. Crea un valutatore

Fai riferimento ai Free Large Language Models (LLM) come giudici

I Large Language Models (LLM) come giudici si riferiscono a un metodo di valutazione che utilizza un Large Language Model (LLM) per valutare automaticamente la qualità, la correttezza o l'efficacia dell'output di un agente o di un altro modello. Invece di affidarsi alla revisione manuale o ai controlli basati su regole, al LLM vengono richiesti criteri di valutazione e produce un punteggio, un'etichetta o una spiegazione in base all'input e all'output da valutare. A differenza delle valutazioni tradizionali che si basano su dati fondati, i LLM-as-a-judge metodi si basano sulle conoscenze interne del modello per formulare giudizi. Questo approccio consente valutazioni qualitative scalabili, coerenti e personalizzabili, come la correttezza, la qualità del ragionamento o l'aderenza alle istruzioni, su un gran numero di interazioni tra agenti o risposte del modello.