Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Terminologia di valutazione
La comprensione dei concetti e della terminologia chiave è essenziale per utilizzare AgentCore efficacemente le valutazioni. I seguenti termini definiscono i componenti e i processi principali coinvolti nella valutazione degli agenti.
Argomenti
Agent Framework
Un framework per agenti fornisce i componenti fondamentali per la creazione, l'orchestrazione e l'esecuzione di applicazioni basate su agenti. I framework definiscono strutture come passaggi, strumenti, flusso di controllo e gestione della memoria. I framework di settore più comuni includono Strands Agents
Per ulteriori informazioni sui framework supportati, vedere Framework per agenti supportati. Framework per agenti supportati
Libreria di strumentazione
Una libreria di strumentazione registra la telemetria generata dall'agente durante l'esecuzione. Questa telemetria può includere tracce, intervalli, richiami agli strumenti, richiami ai modelli e passaggi intermedi. Le librerie come OpenTelemetry e OpenInference offrono API standardizzate e convenzioni semantiche che consentono di acquisire il comportamento degli agenti con modifiche minime al codice. La strumentazione è necessaria per la raccolta e la valutazione delle tracce.
Per ulteriori informazioni sulle librerie di strumentazione supportate, vedere Frameworks di agenti supportati.
Instrumentation Agent
Un agente di strumentazione acquisisce automaticamente la telemetria dal codice dell'applicazione, la elabora e la esporta in un servizio di backend per l'archiviazione o la valutazione. Strumenti come ADOT (AWS Distro for OpenTelemetry) forniscono un agente di strumentazione automatica indipendente dal fornitore e pronto per la produzione che inietta dinamicamente bytecode per acquisire tracce senza modifiche al codice. L'agente è un componente chiave per consentire la valutazione automatica.
AgentCore Evaluations attualmente supporta ADOT (AWS Distro for OpenTelemetry) come agente di strumentazione.
Sessione
Una sessione rappresenta un raggruppamento logico di interazioni correlate da un singolo utente o flusso di lavoro. Una sessione può contenere una o più tracce. Le sessioni consentono di visualizzare e valutare il comportamento degli agenti attraverso interazioni in più fasi, anziché concentrarsi sulle singole richieste.
Traccia
Una traccia è una registrazione completa dell'esecuzione o della richiesta di un singolo agente. Una traccia contiene uno o più intervalli, che rappresentano le singole operazioni eseguite durante tale esecuzione. Le tracce forniscono una visibilità completa sulle decisioni degli agenti e sull'utilizzo degli strumenti.
Tool Call
Una chiamata a uno strumento è un intervallo che rappresenta l'invocazione da parte di un agente di una funzione, API o capacità esterna. Gli intervalli di chiamate agli strumenti in genere acquisiscono informazioni come il nome dello strumento, i parametri di input, il tempo di esecuzione e l'output. I dettagli delle chiamate all'utensile vengono utilizzati per valutare se l'agente ha selezionato e utilizzato gli strumenti in modo corretto ed efficiente.
Competenza
Una skill è un file di istruzioni riutilizzabile che un agente carica in fase di esecuzione per facilitare l'esecuzione di un'operazione. Le competenze seguono lo standard aperto SKILL.md file direttamente dal filesystem. AgentCore Evaluations rileva le invocazioni di abilità dalle tracce di un agente. Per valutarle, utilizza i valutatori di abilità integrati o i valutatori TOOL_CALL personalizzati che fanno riferimento ai segnaposto delle competenze. Crea un valutatore
Fai riferimento ai Free Large Language Models (LLM) come giudici
I Large Language Models (LLM) come giudici si riferiscono a un metodo di valutazione che utilizza un Large Language Model (LLM) per valutare automaticamente la qualità, la correttezza o l'efficacia dell'output di un agente o di un altro modello. Invece di affidarsi alla revisione manuale o ai controlli basati su regole, al LLM vengono richiesti criteri di valutazione e produce un punteggio, un'etichetta o una spiegazione in base all'input e all'output da valutare. A differenza delle valutazioni tradizionali che si basano su dati fondati, i LLM-as-a-judge metodi si basano sulle conoscenze interne del modello per formulare giudizi. Questo approccio consente valutazioni qualitative scalabili, coerenti e personalizzabili, come la correttezza, la qualità del ragionamento o l'aderenza alle istruzioni, su un gran numero di interazioni tra agenti o risposte del modello.