View a markdown version of this page

可用性の変更を明確にする - Amazon SageMaker AI

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

可用性の変更を明確にする

注記

Amazon SageMaker Clarify は新規顧客に公開されなくなりました。既存のお客様は、引き続きこのサービスを通常どおり使用できます。 は AWS 引き続き Clarify のセキュリティと可用性の向上に投資しますが、新機能を導入する予定はありません。

AWSが公開したモニタリングソリューション、標準化されたバイアスメトリクス、SHAP、Amazon Bedrock 評価

AWS公開されたオープンソースの SageMaker AI モニタリングソリューション、標準化されたバイアスメトリクス Clarify レポートのベース計算、SageMaker Clarify 自体が構築されている SHAP ライブラリ、Amazon SageMaker AI MLflowAmazon CloudWatchAmazon QuickSightAmazon Bedrock Evaluations の組み合わせは、Amazon SageMaker Clarify の代替として機能します。このガイダンスでは、以下について説明します。

  • AWSが公開したリファレンスソリューションは基盤です。aws-samples GitHub 組織内のオープンソースの Amazon SageMaker AI モニタリングソリューションは、 AWS マネージドサービス (Amazon SageMaker AI、SageMaker AI MLflow、Amazon Athena、 AWS Lambda、Amazon EventBridge、Amazon SQS、Amazon SNS、Amazon QuickSight) 上に完全に構築された本番テスト済みのリファレンスアーキテクチャです。これらは独自の AWS アカウント内で実行され、アドホックスクリプトとしてではなく、管理されたend-to-endのパイプラインの一部としてバイアス分析と説明可能性分析を運用化します。これらは、SageMaker Model Monitor 移行ガイダンスで使用されるリファレンスソリューションと同じです。

  • バイアスメトリクスは標準化された算術であり、ライブラリの依存関係ではありません。Clarify のトレーニング前およびトレーニング後のバイアスメトリクス (DPL、DPPL、DI、CI、および関連メジャー) は、ラベル数と混同行列値から計算された業界標準の計算式として公開されています。pandas と scikit-learn、所有するコード、テストコード、独自のパイプライン内のバージョンを使用して再現します。

  • SHAP は、Clarify が使用するエンジンと同じです。SageMaker Clarify は、内部的に SHAP ライブラリを使用して特徴属性を計算します (Clarify SHAP 値のドキュメントを参照)。SHAP を直接採用すると、Shapley 値の属性が生成されます。

  • 基盤モデルのみの Amazon Bedrock 評価。Amazon Bedrock 評価と Amazon Bedrock ガードレールは、LLM と生成 AI 評価の AWSマネージドパスです。これらは、Clarify の基盤モデル評価 (FMEval) 機能を置き換えます。これらは、予測的 (表形式/古典的な ML) バイアス検出や説明可能性に代わるものではありません。

Clarify の削除

新しい分析のために Clarify 処理ジョブを中止する

ワークフローに SageMaker Python SDK の SageMakerClarifyProcessor クラス、/ clarify.BiasConfig clarify.SHAPConfig設定、または run_bias() / run_explainability()メソッドを使用した SageMaker Clarify 処理ジョブの実行が含まれている場合は、以下の「置き換えの設定」セクションで説明されている代替方法に移行します。

Clarify 出力アーティファクトを削除または保持する (オプション)

Clarify Processing Jobs は出力アーティファクトを Amazon S3 に保存します。

  • バイアス分析レポート: analysis.json、トレーニング前とトレーニング後のバイアスメトリクスを含む

  • SHAP の説明: explanations_shap/out.csv、インスタンスごとのローカル SHAP 値

  • グローバル SHAP 値: 集計された特徴量重要度スコア

  • 部分依存プロット (PDPs): 特徴量効果の視覚化

  • 制約ファイル: Model Monitor がバイアスドリフトと特徴属性ドリフトベースラインに使用します

コンプライアンス、規制監査証跡、または履歴参照のためにこれらを保持する必要がある場合は、S3 に残すか、S3 Glacier にアーカイブします。不要になった場合は、S3 プレフィックスを削除します。

SageMaker Pipelines から Clarify を削除する (使用する場合)

Clarify を呼び出す ClarifyCheckStepまたは ProcessingStep ステップを持つ SageMaker Pipelines がある場合は、それらを標準化されたメトリクス計算と SHAP ProcessingStepを実行する に置き換えます。これは、 AWS公開されたリファレンスソリューションが SageMaker Pipelines 内で使用するのと同じパターンに従います (以下の置き換えの設定を参照)。

置き換えの設定

置換パスは、pandas と scikit-learn を使用して標準化されたバイアスメトリクスを直接計算し、SHAP (Clarify が使用するのと同じエンジン) を使用して特徴属性を計算します。これらは、 AWS公開されているリファレンスソリューションと SageMaker Pipelines 内で実行し、結果を SageMaker AI MLflow アプリに記録して、バイアスと説明可能性の結果がトレーニングの実行と同じ系統、バージョニング、ガバナンスを持つようにします。

トレーニング前とトレーニング後のバイアス検出の置き換え

Clarify のトレーニング前メトリクスは、ラベル数とクラス比率に基づいて公開され、標準化された数式です。これらを直接計算することで、バイアスチェックをシンプルに、チームが所有し、テスト可能にし、 AWS公開されているリファレンスソリューションがモニタリングジョブ内で実行する内容と整合性を保つことができます。

実装が Clarify の出力と一致するように、各メトリクスの背後にある正確な式については、Clarify トレーニング前バイアスメトリクスリファレンスを参照してください。

Clarify のトレーニング後のメトリクスは、グループあたりの混同行列数の標準化された関数です。予測とグラウンドトゥルースから直接計算することで、チェックをシンプルに保ち、チームが所有し、 AWSが公開したリファレンスソリューションがバイアスドリフトに使用するセグメントごとのアプローチと一致します。セグメントごとの結果を SageMaker AI MLflow アプリに記録して、ガバナンスとトレンド追跡を行います。

メトリクスの背後にある正確な計算式については、Clarify トレーニング後のバイアスメトリクスリファレンスを参照してください。

モデルの説明可能性 (SHAP 特徴属性) の置き換え

SHAP ライブラリは、SageMaker Clarify の説明可能性を強化するエンジンと同じです。直接使用すると、柔軟性が高まります。

pip install shap

本番稼働用の場合、 AWS公開されているリファレンスソリューションには、デプロイされたモデルのグローバルな特徴量重要度、個々の予測説明、特徴量インタラクション分析を生成し、結果を SageMaker AI MLflow アプリに記録する6_shap_explainability.ipynbノートブックが含まれています。

API リファレンスについては、SHAP ドキュメントを参照してください。

バイアスドリフトと特徴属性ドリフトモニタリングの置き換え

このアプローチは、Amazon SageMaker AI モニタリングソリューションを使用して、ガバナンス、系統、アラートを使用して、同じ標準化されたメトリクス (直接計算された公平性メトリクスと SHAP 機能の重要性) をスケジュールどおりに運用します。Model Monitor 移行ガイダンスがデータとモデル品質ドリフトに使用するのと同じ EventBridge + Lambda + Athena (Iceberg) + MLflow + SNS + QuickSight パターンを使用するため、バイアスドリフトと特徴量属性ドリフトは、別のシステムではなく同じガバナンスパイプラインで追加のメトリクスになります。

基盤モデル (LLM) 評価の置き換え

オプション 1: fmeval ライブラリ (SageMaker がホストするモデルに推奨)

fmeval ライブラリは、Clarify の基盤モデル評価が構築されているのと同じ評価エンジンであり、Clarify 処理ジョブとは独立して使用できます。

pip install fmeval

このfmevalライブラリは、テキストの要約、質問への回答、分類、オープンエンド生成、事実に関する知識、毒性、堅牢性 (セマンティック摂動)、プロンプトのステレオタイプ評価をサポートしています。SageMaker エンドポイントでの継続的な本番稼働中の LLM 品質モニタリングの場合、Grafana リファレンスソリューションを使用した AWSLLM 推論モニタリングと LLM 品質オブザーバビリティは、Amazon Bedrock モデルを使用して MLflow 生成 AI 評価 (安全性、関連性、流暢性、ガイドライン、一貫性) を実行します。 https://github.com/aws-samples/sample-aiops-on-amazon-sagemakerai/tree/main/monitoring/quality-monitoring-with-grafana

詳細な手順については、「Fmeval ライブラリを使用して自動評価を実行しAmazon SageMaker マネージド MLflow と FMEval を使用して LLM モデル評価を追跡する」を参照してください。

オプション 2: Amazon Bedrock 評価 (マネージドサービス)

Amazon Bedrock Evaluations は、Clarify 処理ジョブを必要とせずに、基盤モデル評価のマネージド代替手段を提供します。

  1. Amazon Bedrock コンソールを開きます。

  2. 左側のナビゲーションから評価を選択します。

  3. 評価ジョブの作成 を選択します。

  4. 評価タイプを選択します。

    • 自動評価: 精度、頑健性、毒性に関する事前定義されたアルゴリズム

    • 人間による評価: 人間のワーカーを主観的な品質評価に招待する

  5. 評価するモデル (JumpStart モデル、Bedrock モデル、またはカスタムエンドポイント) を選択します。

  6. 組み込みデータセットを選択するか、カスタムプロンプトデータセットをアップロードします。

  7. モデル間で比較メトリクスを使用して評価結果を確認します。

Bedrock Evaluations は、必要な形式で評価データを提供する限り、Bedrock でホストされているモデル、カスタムモデル、外部モデル (オンプレミスまたはマルチクラウドのデプロイを含む) の評価をサポートします。

詳細な手順については、「Amazon Bedrock リソースのパフォーマンスを評価する」および「Amazon Bedrock 評価を使用してモデルまたは RAG システムを評価する」を参照してください。

オプション 3: Amazon Bedrock ガードレール (ランタイム安全)

SageMaker Clarify が評価時に評価するランタイムコンテンツフィルタリング (毒性、PII、有害なコンテンツ) の場合、Amazon Bedrock ガードレールは生成 AI アプリケーションの継続的なランタイム保護を提供します。

  • コンテンツフィルター: 有害、憎悪的、性的、暴力的、侮辱的なコンテンツをブロックする

  • 拒否されたトピック: 特定のトピックでのモデルレスポンスの防止

  • 機密情報フィルター: PII (名前、住所、SSN、クレジットカード) を検出して編集する

  • コンテキストグラウンディングチェック: ソースデータのレスポンスをグラウンディングすることで幻覚を軽減

  • 自動推論チェック: 正式な推論を使用して事実の精度を検証する

詳細な手順については、「Amazon Bedrock ガードレールを使用して有害なコンテンツを検出してフィルタリングする」を参照してください。