View a markdown version of this page

スキル評価者 - Amazon Bedrock AgentCore

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

スキル評価者

スキルは、エージェントが実行時にタスクに役立つようにロードする再利用可能なSKILL.md命令ファイルです。スキルは、スキルファイル構造のオープンエージェントスキル標準に従います。用語については、「 スキル」を参照してください。

AgentCore Evaluations には、スキルを使用するエージェント用に 2 つの組み込み評価者が用意されています。どちらもツールレベルの評価者です。AgentCore Evaluations は、スキル呼び出しごとに 1 つの結果を発行し、各結果をスキルをロードしたツール呼び出しスパンに固定します。スキル呼び出しが 3 つのセッションでは、評価者ごとに 3 つの結果が生成されます。

これらの評価者は、オンデマンド、バッチ、オンラインの評価で使用できます。正確なプロンプト本文については、プロンプトテンプレートページの次のスキル選択精度とスキル指示を参照してください。

Builtin.SkillSelectionAccuracy

スキル選択精度評価者 (Builtin.SkillSelectionAccuracy) は、使用可能なスキルのカタログを考慮して、エージェントがロードしたスキルがタスクに適しているかどうかを判断します。Yes (1.0) または No (0.0) を返します。

評価者が使用するプレースホルダー:

  • invoked_skill – このツール呼び出しでエージェントがロードしたスキルの名前。

  • available_skills – エージェントが実行時に選択できるスキルのカタログ。すべてのフレームワークがカタログを公開しているわけではありません。カタログがトレースにない場合、このプレースホルダーは空であり、評価者は呼び出したスキルをユーザーリクエストと会話コンテキストのみに対して判断します。

  • user_message – スキル呼び出しをトリガーしたターンのユーザーリクエスト。

  • context - 以前には、評価対象のツール呼び出しが表示されます。

評価者は、AgentCore Evaluations がスキル呼び出しを検出するたびに実行されます。エージェントがスキルをどのように実行したかではなく、選択の決定に焦点を当てます。

Builtin.SkillInstructionFollowing

評価者 (Builtin.SkillInstructionFollowing) に続くスキル指示は、エージェントがロードされたスキルの所定のステップにどの程度完全に従ったかを判断します。(1.0)Fully Followed、 Mostly Followed (0.75)Partially Followed、 (0.5)、 Minimally Followed (0.25)、または Not Followed (0.0) を返します。

評価者が使用するプレースホルダー:

  • invoked_skill – このツール呼び出しでエージェントがロードしたスキルの名前。

  • skill_content – ロードされたスキルSKILL.mdの指示の全体。

  • context – 完全なセッションコンテキスト — セッション開始からセッション終了までのすべてのターン。エージェントがスキルを読み込んだ後、任意の時点で所定のステップを実行する可能性があるため、判事はツール呼び出しへのターンアップだけでなく、セッション全体を必要とします。

評価者は、呼び出されたスキルとそのSKILL.md本文の両方がトレースに存在する場合にのみ実行されます。審査員は、スキル本文に規定されたステップを特定し、ステップごとに、会話レコードからステップが完全に実行されたか、部分的に実行されたか、スキップされたかを判断し、そのステップごとの内訳と一致する全体的な評価を生成します。

フレームワークのサポート

AgentCore Evaluations は、SKILL.mdファイルのファイルシステムの読み取りとフレームワークのネイティブスキルロードツールの 2 種類のトレースシグナルからスキル呼び出しを検出します。ファイルシステム読み取りシグナルは、どのフレームワークでも機能します。ネイティブツールシグナルは、次の表の 2 行目の特定のフレームワークに適用されます。

検出方法

フレームワーク

SKILL.md ファイル読み取り (ユニバーサル)

LlamaIndex、OpenAI エージェント、および汎用ファイル読み取りツールSKILL.mdを介して読み取るすべてのエージェント。

ネイティブスキルロードツール (ファイル読み取りに加えて)

Strands Agents、LangGraph Deep Agents、Google ADK、Claude Agent SDK。

ファイル読み取りパスの場合、AgentCore Evaluations は、パラメータに で終わるパスが含まれ/SKILL.md、ツール結果本文が適切な形式のSKILL.mdファイル ( name フィールドと descriptionフィールドのフロントマター、その後に指示本文) である場合に、ツール呼び出しをスキルロードとして一致させます。

利用可能なスキルカタログは、Strands Agents、LangGraph Deep Agents、Google ADK によってネイティブに出力されます。Claude Agent SDK およびファイル読み取りエージェントはカタログを出力しません。 Builtin.SkillSelectionAccuracy は、これらのエージェントで空のavailable_skillsプレースホルダーを使用して実行されます。

一般的な計測のセットアップとフレームワークごとのスコープ名については、「サポートされているエージェントフレームワーク」を参照してください。

スキップ動作

AgentCore Evaluations は、トレースがその呼び出しskill_contentに対して invoked_skillまたは を公開したときに、ツール呼び出しをスキル呼び出しとして分類します。どちらのシグナルも存在しない場合、AgentCore Evaluations はその呼び出しの両方のスキル評価者をスキップし、結果は出力しません。エージェントがスキルをロードしない場合、両方の評価者はセッションの結果をゼロにします。これはエラーではなく予想されます。

エージェントがスキルをロードしても評価者が結果を返さない場合は、診断スキルソースで診断スキルを実行して、トレースが予想されるシグナルを伝達することを確認します。

カスタム評価者のスキルプレースホルダー

エージェントがロードしたスキルに関する理由を示すカスタム TOOL_CALL 評価者を記述できます。上記のスキルプレースホルダー (invoked_skill、skill_content、available_skills、user_message) は、標準のツールレベルのプレースホルダー (context、、) とともに、任意のカスタム TOOL_CALL available_tools評価者で使用できますtool_turn。セッションレベルとトレースレベルのカスタム評価者は、これらのプレースホルダーを使用できません。

AgentCore Evaluations の動作は、カスタム評価者が参照するスキルプレースホルダーによって異なります。

  • を参照する評価者invoked_skillは のように動作しますBuiltin.SkillSelectionAccuracy。スキル呼び出しツール呼び出しでのみ実行され、標準の呼び出し前スナップショットを{context}レンダリングします。

  • を参照する評価者は のようにskill_content動作しますBuiltin.SkillInstructionFollowing。SKILL.md本文が使用可能なスキル呼び出しツール呼び出しでのみ実行され、セッション開始からセッション終了までのすべてのターンで完全なセッションコンテキストを{context}レンダリングします。これは、標準のツールレベルの とは異なりますcontext。

いずれの場合も、AgentCore Evaluations はスキル呼び出しごとに 1 つの結果を発行します。カスタム評価者の作成については、「評価者の作成」を参照してください。