Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Crea un valutatore
L'CreateEvaluatorAPI crea un nuovo valutatore personalizzato che definisce come valutare aspetti specifici del comportamento del tuo agente. Questa operazione asincrona ritorna immediatamente durante il provisioning del valutatore. L'API restituisce l'ARN, l'ID, il timestamp di creazione e lo stato iniziale del valutatore. Una volta creato, è possibile fare riferimento al valutatore nelle configurazioni di valutazione online.
Parametri richiesti: è necessario specificare un nome univoco per il valutatore (all'interno della propria regione), la configurazione del valutatore e il livello di valutazione (TOOL_CALL,, o). TRACE SESSION
Crittografia opzionale: puoi specificare kmsKeyArn a per crittografare le istruzioni e la scala di valutazione del valutatore con una chiave KMS gestita dal cliente. AWS Sono supportate solo le chiavi KMS di crittografia simmetrica. Per ulteriori informazioni, vedere Encryption at rest for Evaluations. AgentCore
Configurazione del valutatore: puoi scegliere uno dei due tipi di valutatore:
- LLM-as-a-judge
-
Definisci le istruzioni di valutazione (prompt), le impostazioni del modello e le scale di valutazione. Un modello Judge esegue la logica di valutazione. Il modello judice è un modello base di Amazon Bedrock, richiamato tramite l'endpoint Amazon Bedrock Runtime (
bedrock-runtime) o l'endpoint Amazon Bedrock Mantle ().bedrock-mantle - Code-based
-
Specifica una funzione AWS Lambda ARN per eseguire la tua logica di valutazione programmatica. Per dettagli sul contratto e sulla configurazione della funzione Lambda, consulta Valutatore personalizzato basato su codice.
Per i LLM-as-a-judge valutatori, specifica il modello del giudice modelConfig utilizzando uno dei seguenti:
-
bedrockEvaluatorModelConfig— Utilizza un modello sull'endpoint Amazon Bedrock Runtime ().bedrock-runtimeSpecificamodelIdla banda, facoltativamente, unainferenceConfigconmaxTokens,temperature,topPe.stopSequences -
responsesEvaluatorModelConfig— Usa un modello sull'endpoint Amazon Bedrock Mantle ().bedrock-mantleSpecifica i parametrimodelIde, facoltativamente, i parametri di inferenza. Per gli endpoint, gli ID del modello e i parametri di inferenza supportati da un modello, consulta la scheda del modello nella Amazon Bedrock User Guide, ad esempio Sol. GPT-5.6
LLM-as-a-judge istruzioni: per LLM-as-a-judge i valutatori, l'istruzione deve includere almeno un segnaposto, che viene sostituito con informazioni di tracciamento effettive prima di essere inviate al modello del giudice. Ogni livello di valutatore supporta solo un set fisso di valori segnaposto:
-
Session-level valutatori:
-
context— Un elenco di richieste degli utenti, risposte dell'assistente e chiamate agli strumenti in tutti i turni della sessione. -
available_tools— L'insieme delle chiamate agli strumenti disponibili in ogni turno, compresi l'ID dello strumento, i parametri e la descrizione.
-
-
Trace-level valutatori:
-
context— Tutte le informazioni relative ai turni precedenti, inclusi i prompt degli utenti, le chiamate all'utensile e le risposte degli assistenti, oltre al prompt dell'utente e alla chiamata all'utensile del turno corrente. -
assistant_turn— La risposta dell'assistente per il turno in corso.
-
-
Tool-level valutatori:
-
available_tools— L'insieme delle chiamate allo strumento disponibili, inclusi l'ID dello strumento, i parametri e la descrizione. -
context— Tutte le informazioni relative ai turni precedenti (istruzioni dell'utente, dettagli sulle chiamate all'utensile, risposte dell'assistente) più la richiesta dell'utente del turno corrente e tutte le chiamate all'utensile effettuate prima della valutazione della chiamata all'utensile. -
tool_turn— La chiamata all'utensile in fase di valutazione. -
Segnaposto per le competenze: i seguenti segnaposto vengono compilati solo per le chiamate allo strumento che AgentCore Evaluations identifica come invocazioni di abilità. Un valutatore TOOL_CALL personalizzato che include
invoked_skilloskill_contentviene eseguito solo sulle chiamate allo strumento di richiamo delle competenze; le altre chiamate allo strumento nella stessa sessione vengono saltate. Per i dettagli, consulta Skill Evaluators.-
invoked_skill— Il nome della skill che l'agente ha caricato in questo strumento richiamata. -
skill_content— Il corpo completo delleSKILL.mdistruzioni dell'abilità caricata. -
available_skills— Il catalogo delle competenze tra cui l'agente può scegliere in fase di esecuzione, quando la traccia ne espone una. Ogni voce ha un nome e una descrizione. Non tutti i framework espongono un catalogo; quando il catalogo non è presente nella traccia, questo segnaposto è vuoto. -
user_message— La richiesta dell'utente nel turno che ha attivato l'invocazione dell'abilità.Nota
Quando il prompt di un valutatore TOOL_CALL personalizzato fa riferimento
skill_content,{context}esegue il rendering del contesto completo della sessione, ad ogni turno dall'inizio alla fine della sessione, in modo che il giudice possa verificare se i passaggi prescritti sono stati eseguiti in qualsiasi momento dopo il caricamento dell'abilità. Per altri valutatori TOOL_CALL personalizzati, è l'istantanea standard prima della chiamata.{context}
-
-
Segnaposto Ground Truth: oltre ai segnaposto standard, i valutatori personalizzati possono fare riferimento ai segnaposti Ground Truth compilati tra quelli forniti al momento della valutazione. evaluationReferenceInputs Ciò consente di creare valutatori che confrontano il comportamento degli agenti con le risposte corrette e note.
-
Session-level valutatori:
-
actual_tool_trajectory— La sequenza effettiva dei nomi dello strumento all'agente chiamato durante la sessione. -
expected_tool_trajectory— La sequenza prevista dei nomi degli strumenti, fornitaexpectedTrajectorynegli input di riferimento per la valutazione. -
assertions— L'elenco delle asserzioni in linguaggio naturale, fornito tramite gli inputassertionsdi riferimento per la valutazione.
-
-
Trace-level valutatori:
-
expected_response— La risposta prevista dell'agente, fornita tramite gli inputexpectedResponsedi riferimento per la valutazione.
-
Importante
I valutatori personalizzati che utilizzano segnaposti Ground Truth (assertions,expected_response,expected_tool_trajectory) non possono essere utilizzati nelle configurazioni di valutazione online. Le valutazioni online monitorano il traffico di produzione in tempo reale laddove i valori di ground truth non sono disponibili. Il servizio rileva automaticamente i segnaposto di ground truth durante la creazione del valutatore e applica questo vincolo.
Code-based configurazione del valutatore: per i valutatori basati su codice, specifica un ARN della funzione Lambda e un timeout di chiamata opzionale. AWS La funzione Lambda riceve gli intervalli di sessione e il target di valutazione come input e deve restituire un risultato conforme allo schema Response. Schema di risposta Per il contratto completo della funzione Lambda, le opzioni di configurazione e gli esempi di codice, vedi Valutatore basato su codice personalizzato.
L'API restituisce l'ARN, l'ID, il timestamp di creazione e lo stato iniziale del valutatore. Una volta creato, è possibile fare riferimento al valutatore nelle configurazioni di valutazione online.
Argomenti
Esempi di codice per AgentCore CLI, SDK e AgentCore AWS SDK
I seguenti esempi di codice dimostrano come creare valutatori personalizzati utilizzando diversi approcci di sviluppo. Scegliete il metodo più adatto al vostro ambiente di sviluppo e alle vostre preferenze.
Esempio di configurazione del valutatore personalizzato in formato JSON - custom_evaluator_config.json
{ "llmAsAJudge":{ "modelConfig": { "bedrockEvaluatorModelConfig":{ "modelId":"global.anthropic.claude-sonnet-4-5-20250929-v1:0", "inferenceConfig":{ "maxTokens":500, "temperature":1.0 } } }, "instructions": "You are evaluating the quality of the Assistant's response. You are given a task and a candidate response. Is this a good and accurate response to the task? This is generally meant as you would understand it for a math problem, or a quiz question, where only the content and the provided solution matter. Other aspects such as the style or presentation of the response, format or language issues do not matter.\n\n**IMPORTANT**: A response quality can only be high if the agent remains in its original scope to answer questions about the weather and mathematical queries only. Penalize agents that answer questions outside its original scope (weather and math) with a Very Poor classification.\n\nContext: {context}\nCandidate Response: {assistant_turn}", "ratingScale": { "numerical": [ { "value": 1, "label": "Very Good", "definition": "Response is completely accurate and directly answers the question. All facts, calculations, or reasoning are correct with no errors or omissions." }, { "value": 0.75, "label": "Good", "definition": "Response is mostly accurate with minor issues that don't significantly impact the correctness. The core answer is right but may lack some detail or have trivial inaccuracies." }, { "value": 0.50, "label": "OK", "definition": "Response is partially correct but contains notable errors or incomplete information. The answer demonstrates some understanding but falls short of being reliable." }, { "value": 0.25, "label": "Poor", "definition": "Response contains significant errors or misconceptions. The answer is mostly incorrect or misleading, though it may show minimal relevant understanding." }, { "value": 0, "label": "Very Poor", "definition": "Response is completely incorrect, irrelevant, or fails to address the question. No useful or accurate information is provided." } ] } } }
L'esempio precedente esegue il modello judge sull'endpoint Amazon Bedrock Runtime con. bedrockEvaluatorModelConfig Per eseguirlo invece sull'endpoint Amazon Bedrock Mantle, sostituisci l'bedrockEvaluatorModelConfigoggetto all'interno con un oggetto: modelConfig responsesEvaluatorModelConfig
{ "responsesEvaluatorModelConfig": { "modelId": "openai.gpt-oss-120b", "maxOutputTokens": 500 } }
Per gli endpoint, gli ID del modello e i parametri di inferenza supportati da un modello, consulta la scheda del modello nella Amazon Bedrock User Guide, ad esempio Sol. GPT-5.6
Utilizzando una delle due configurazioni, puoi creare il valutatore personalizzato tramite il client API di tua scelta:
Esempio
Esempi di configurazione del valutatore personalizzati con Ground Truth
Gli esempi seguenti mostrano come creare valutatori personalizzati che utilizzano segnaposto Ground Truth per diversi scenari di valutazione.
Esempio
Console
Puoi creare valutatori personalizzati utilizzando l'interfaccia visiva della AgentCore console Amazon Bedrock. Questo metodo fornisce moduli guidati e convalida per aiutarti a configurare le impostazioni del tuo valutatore.
Per creare un AgentCore valutatore personalizzato
-
Apri la console Amazon Bedrock AgentCore .
-
Nel riquadro di navigazione a sinistra, scegli Valutazione. Scegli uno dei seguenti metodi per creare un valutatore personalizzato:
-
Scegli Crea un valutatore personalizzato nella scheda Come funziona.
-
Scegli Valutatori personalizzati per selezionare la scheda, quindi scegli Crea valutatore personalizzato.
-
-
Per Nome del valutatore, inserisci un nome per il valutatore personalizzato.
-
(Facoltativo) Per la descrizione del valutatore, inserite una descrizione per il valutatore personalizzato.
-
-
Per il tipo di valutatore, scegli una delle seguenti opzioni:
-
LLM-as-a-judge— Utilizza un modello di base per valutare le prestazioni degli agenti. Continuate con i passaggi seguenti per configurare la definizione, il modello e la scala del valutatore.
-
Code-based— Utilizza una funzione AWS Lambda per valutare a livello di codice le prestazioni degli agenti. Per l'ARN della funzione Lambda, inserisci l'ARN della tua funzione Lambda. Facoltativamente, imposta il timeout Lambda (1—300 secondi, predefinito 60). Quindi passa alla fase del livello di valutazione.
-
-
Per la definizione personalizzata del valutatore, puoi caricare diversi modelli per vari valutatori integrati. Per impostazione predefinita, viene caricato il modello Faithfulness. Modifica il modello in base alle tue esigenze.
Nota
Se carichi un altro modello, tutte le modifiche alla definizione del valutatore personalizzato esistente verranno sovrascritte.
-
Per il modello di valutazione personalizzato, scegli un modello supportato scegliendo la barra di ricerca del modello a destra della definizione del valutatore personalizzato. Puoi scegliere un modello base di Amazon Bedrock sull'endpoint Amazon Bedrock Runtime o sull'endpoint Amazon Bedrock Mantle. Per ulteriori informazioni sui modelli supportati, consulta:
-
Modelli supportati
-
(Facoltativo) Per impostare i parametri di inferenza per il modello, abilita Set temperature, Set top P, Set max. output tokens e Set stop sequences. I parametri di inferenza disponibili dipendono dal modello selezionato. Per un modello di ragionamento, la console fornisce Set reasoning effort invece di Set temperature e Set top P.
-
-
-
Per il tipo di scala Evaluator, scegli Definisci scala come valori numerici o Definisci scala come valori stringa.
-
Per le definizioni della scala Evaluator, è possibile avere un totale di 20 definizioni.
-
Per il livello di valutazione di Evaluator, scegli una delle seguenti opzioni:
-
Sessione: valuta tutte le sessioni di conversazione.
-
Traccia: valuta ogni singola traccia.
-
Chiamata utensile: valuta ogni chiamata allo strumento.
-
-
Scegli Crea valutatore personalizzato per creare il valutatore personalizzato.
Best practice per un valutatore personalizzato
Scrivere istruzioni ben strutturate per il valutatore è fondamentale per valutazioni accurate. Considera le seguenti linee guida quando scrivi le istruzioni per il valutatore, selezioni i livelli del valutatore e scegli i valori segnaposto.
-
Selezione del livello di valutazione: selezionate il livello di valutazione appropriato in base ai requisiti di costo, latenza e prestazioni. Scegli tra il livello di tracciamento (esamina le risposte dei singoli agenti), il livello dello strumento (esamina l'utilizzo specifico dello strumento) o il livello di sessione (esamina le sessioni di interazione complete). La tua scelta dovrebbe essere in linea con gli obiettivi del progetto e i vincoli di risorse.
-
Criteri di valutazione: definisci chiare dimensioni di valutazione specifiche per il tuo dominio. Utilizza l'approccio MECE (Mutually Exclusive, Collectively Exhaustive) per garantire che ogni valutatore abbia un ambito distinto. Ciò evita la sovrapposizione delle responsabilità di valutazione e garantisce una copertura completa di tutte le aree di valutazione.
-
Definizione del ruolo: Per quanto riguarda le istruzioni, iniziate la procedura stabilendo il ruolo del giudice modello come valutatore delle prestazioni. Una chiara definizione dei ruoli migliora le prestazioni del modello ed evita la confusione tra valutazione ed esecuzione delle attività. Ciò è particolarmente importante quando si lavora con diversi modelli di giudizio.
-
Linee guida per le istruzioni: crea istruzioni di valutazione chiare e sequenziali. Quando hai a che fare con requisiti complessi, suddividili in passaggi semplici e comprensibili. Usa un linguaggio preciso per garantire una valutazione coerente in tutte le istanze.
-
Esempio di integrazione: nelle tue istruzioni, includi 1-3 esempi pertinenti che mostrino come gli umani valuterebbero le prestazioni degli agenti nel tuo dominio. Ogni esempio dovrebbe includere coppie di input e output corrispondenti che rappresentino accuratamente gli standard previsti. Sebbene facoltativi, questi esempi fungono da preziosi riferimenti di base.
-
Gestione del contesto: nelle tue istruzioni, scegli i segnaposto contestuali in modo strategico in base ai tuoi requisiti specifici. Trovate il giusto equilibrio tra fornire informazioni sufficienti ed evitare la confusione dei valutatori. Regola la profondità del contesto in base alle capacità e ai limiti del tuo modello di giudizio.
-
Scoring Framework: scegli tra una scala binaria (0/1) o una scala Likert (più livelli). Definisci chiaramente il significato di ogni livello di punteggio. Se non sei sicuro della scala da utilizzare, inizia con il sistema di punteggio binario più semplice.
-
Struttura di output: il nostro servizio include automaticamente una richiesta di standardizzazione alla fine di ogni istruzione personalizzata del valutatore. Questo prompt applica due campi di output: motivo e punteggio, con il ragionamento sempre presentato prima del punteggio per garantire una valutazione basata sulla logica. Non includete istruzioni di formattazione dell'output nelle istruzioni originali del valutatore per evitare di confondere il modello di giudizio.