View a markdown version of this page

機械学習ベースのマッチングワークフローの作成 - AWS Entity Resolution

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

機械学習ベースのマッチングワークフローの作成

機械学習ベースのマッチングは、入力したすべてのデータのレコードを照合しようとするプリセットプロセスです。機械学習ベースのマッチングワークフローを使用すると、クリアテキストデータを比較して、機械学習モデルを使用して幅広いマッチングを見つけることができます。

注記

機械学習モデルは、ハッシュ化されたデータの比較をサポートしていません。

がデータ AWS Entity Resolution を処理すると、以下が割り当てられます。

  • すべてのレコードに一致する ID。

  • レコードがデータ内の他の 1 つ以上のレコードと一致する場合:

ML ベースのマッチングワークフローの出力をデータサービスプロバイダーマッチングの入力として使用することも、その逆を使用して特定の目標を達成することもできます。たとえば、ML ベースのマッチングを実行して、最初に独自のレコードでデータソース間のマッチングを検索できます。サブセットが一致しなかった場合は、プロバイダーのサービスベースのマッチングを実行して、追加のマッチングを見つけることができます。

前提条件

ML ベースのマッチングワークフローを作成する前に、以下を行う必要があります。

  1. スキーママッピングを作成します。詳細については、「スキーママッピングの作成」を参照してください。

  2. Connect Customer Profiles を出力先として使用する場合は、適切なアクセス許可が設定されていることを確認してください。

ML ベースのマッチングワークフローを作成するには:
  1. にサインイン AWS マネジメントコンソール し、https://console.aws.amazon.com/entityresolution/ で AWS Entity Resolution コンソールを開きます。

  2. 左側のナビゲーションペインのワークフローで、一致を選択します。

  3. 一致するワークフローページの右上隅で、一致するワークフローの作成を選択します。

  4. ステップ 1: 一致するワークフローの詳細を指定するには、以下を実行します。

    1. 一致するワークフロー名とオプションの 説明を入力します。

    2. データ入力で、、AWS リージョンAWS Glue データベース、AWS Glue テーブルを選択し、対応するスキーママッピングを選択します。

      最大 20 個のデータ入力を追加できます。

    3. データ正規化オプションはデフォルトで選択され、一致する前にデータ入力が正規化されます。データを正規化しない場合は、データの正規化オプションの選択を解除します。

      機械学習ベースのマッチングでは名前、、電話、 のみが正規化されますE メール。

    4. サービスアクセス許可を指定するには、 オプションを選択し、推奨アクションを実行します。

      オプション 推奨されるアクション
      新しいサービスロールを作成して使用
      • AWS Entity Resolution は、このテーブルに必要なポリシーを持つサービスロールを作成します。

      • デフォルトの [サービスロール名] は entityresolution-matching-workflow-<timestamp> です。

      • ロールを作成してポリシーをアタッチするアクセス許可が必要です。

      • 入力データが暗号化されている場合は、このデータは KMS キーオプションで暗号化されます。次に、データ入力の復号に使用される AWS KMS キーを入力します。

      既存のサービスロールを使用
      1. ドロップダウンリストから [既存のサービスロール名] を選択します。

        ロールを一覧表示するアクセス許可がある場合は、ロールのリストが表示されます。

        ロールを一覧表示するアクセス許可がない場合は、使用するロールの Amazon リソースネーム (ARN) を入力できます。

        既存のサービスロールがない場合、[既存のサービスロールを使用] オプションは使用できません。

      2. [IAM で表示] 外部リンクを選択してサービスロールを表示します。

        デフォルトでは、 AWS Entity Resolution は既存のロールポリシーを更新して必要なアクセス許可を追加しようとしません。

    5. (オプション) リソースのタグを有効にするには、新しいタグを追加を選択し、キーと値のペアを入力します。

    6. [次へ] を選択します。

  5. ステップ 2: 一致する手法を選択するには:

    1. マッチング方法 で、機械学習ベースのマッチングを選択します。

      AWS Entity Resolution ワークフロー作成インターフェイスとルールベースまたは機械学習マッチングのオプションとのマッチング。
    2. Processing cadence で、次のいずれかのオプションを選択します。

      • 手動 を選択してバッチマッチングワークフローを実行し、S3 バケット内のデータ全体を処理します。

      • 自動 を選択して、S3 バケット内の増分データのみを処理する増分マッチングワークフローを実行します。

    3. [次へ] を選択します。

  6. ステップ 3: データ出力と形式を指定するには:

    1. データ出力の送信先と形式については、データ出力の Amazon S3 の場所と、データ形式を正規化データまたは元のデータのどちらにするかを選択します。

    2. 暗号化 で、暗号化設定をカスタマイズする場合は、AWS KMS キー ARN を入力します。

    3. システム生成の出力を表示します。

    4. データ出力では、含めるフィールド、非表示にするフィールド、またはマスクするフィールドを決定し、目標に基づいて推奨アクションを実行します。

      目標 推奨されるオプション
      フィールドを含める 出力状態をインクルードのままにします。
      フィールドを非表示 (出力から除外) Output フィールドを選択し、Hide を選択します。
      マスクフィールド 出力フィールドを選択し、ハッシュ出力を選択します。
      以前の設定をリセットする [リセット] を選択します。
    5. [次へ] を選択します。

  7. ステップ 4: 確認して作成する:

    1. 前のステップで行った選択内容を確認し、必要に応じて編集します。

    2. Create and run を選択します。

      一致するワークフローが作成され、ジョブが開始されたことを示すメッセージが表示されます。

  8. 一致するワークフローの詳細ページのメトリクスタブで、「最後のジョブメトリクス」で以下を表示します。

    • ジョブ ID。

    • 一致するワークフロージョブのステータス: Queued、In progress、Completed、Failed

    • ワークフロージョブの完了時刻。

    • 処理されたレコードの数。

    • 処理されていないレコードの数。

    • 生成された一意の一致 IDs。

    • 入力レコードの数。

    ジョブ履歴で以前に実行された一致するワークフロージョブのジョブメトリクスを表示することもできます。

  9. 一致するワークフロージョブが完了したら (ステータスが完了)、データ出力タブに移動し、Amazon S3 の場所を選択して結果を表示できます。この情報は、一致するワークフロージョブによって生成され、出力に含まれます。

    出力フィールド 説明
    MatchID によって生成 AWS Entity Resolution され、一致する各レコードセットに適用される ID。
    ConfidenceLevel Matching-group-level信頼度。
    RecordConfidenceLevel 一致するレコードセットが識別されたときに各レコードに適用されるレコードレベルの信頼度。機械学習の増分マッチングのみ。
    InputSourceARN AWS Glue ワークフロー用に生成された Amazon リソースネーム (ARN)。
    HashingProtocol Secure Hash Algorithm 256 ビット (SHA256)。ハッシュ出力の 32 バイトの文字列を出力します。
  10. (手動処理タイプのみ) 手動処理タイプを使用して機械学習ベースのマッチングワークフローを作成した場合は、一致するワークフローの詳細ページでワークフローの実行を選択して、一致するワークフローをいつでも実行できます。