View a markdown version of this page

最小集計しきい値 - AWS Clean Rooms

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

最小集計しきい値

データ集約は、個人または小グループに関するクエリが結果を返さないようにすることで、匿名化を強制するのに役立つプライバシー強化手法です。テーブルに最小集約しきい値が設定されている場合、 はデータプロバイダーの指定された最小しきい値を満たさない結果を AWS Clean Rooms 抑制します。

集計しきい値

設定されたテーブルのカスタム分析ルールで最小集約しきい値を設定できます。データプロバイダーは、 identityColumnsminimumIdentityCount、N を指定します。 でサポートされる値は 2~100,000 minimumIdentityCountです。identityColumns 値は、stringvarchar、または charタイプである必要があります。最小集計しきい値は、SQL クエリ結果の各行に少なくとも N 個の個別のデータサブジェクトが含まれていることを保証します。がクエリフィルターとidentityColumnsやり取りする方法の詳細については、「」を参照してください比較コントロール

次の例では、 をidentityColumnsuser_idとして、最小集約しきい値を 100 に設定します。

{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT" } ] }

特定の出力列の最小集計しきい値の上書き

出力列の感度レベルは異なり、データプロバイダーは出力列に応じて異なるminimumIdentityCount値を適用できます。たとえば、 campaign_idは感度の低い列で、最小しきい値は 5 つの異なるデータサブジェクトですが、 postal_codeと は感度の高い列であるため、最小しきい値は 100 income_bracketになります。

列ごとのオーバーライドは、その出力列を最小集計から除外0する 、または 2~100,000 の値を受け入れます。

次の例では、 campaign_id列の最小集計しきい値オーバーライドを設定します。

{ "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] }

集計関数でネストされた式を許可する

集計関数内で式を許可すると、クリーンルームクエリでデータセットを再識別できるリスクが高まります。のデフォルト設定allowedAggregateExpressionTypeは でCOLUMNS_ONLY、プライバシー強化設定として推奨されます。この設定では、次のような集計関数内で列のみが受け入れられます。

  • SUM(コスト)

  • COUNT(DISTINCT campaign_id)

または、クエリランナーが信頼できるパートナーであるコラボレーションの場合は、集約関数ANY_EXPRESSION内で を許可できます。この設定により、 がデータに対して実行できる SQL クエリの柔軟性が向上しますが、クエリランナーは集計関数内で小さなグループを分離できるため、プライバシーリスクが生じます。

プライバシーとコンプライアンスのレビューが必要

集計関数ANY_EXPRESSION内で を許可する前に、プライバシー、セキュリティ、法務、コンプライアンスの各チームに相談して、これが組織の要件に準拠していることを確認してください。

以下は、一般的に安全と見なされる集計関数の式の例です。

  • SUM(コスト * 数量)

以下は、プライバシーリスクと見なされる集計関数の式の例です。

  • SUM(CASE WHEN zip_code = '10001' THEN給与 ELSE 0END)

以下は完全なaggregationThresholds例です。

{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT", "allowedAggregateExpressionType": "COLUMNS_ONLY", "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] } ] }

コンソールでの最小集約しきい値の設定

設定されたテーブルが存在した後、設定されたテーブルにカスタム分析ルールを追加する一環として、最小集計しきい値を設定します。完全なカスタム分析ルールガイド付きフローについては、「」を参照してくださいカスタム分析ルールのテーブルへの追加 (ガイドフロー)

最小集計しきい値を設定するには
  1. にサインイン AWS マネジメントコンソール し、https://console.aws.amazon.com/cleanrooms で AWS Clean Rooms コンソールを開きます。

  2. 左側のナビゲーションペインで、テーブルを選択し、設定したテーブルを選択します。

  3. 設定済みテーブルの詳細ページで、[分析ルールを設定] を選択します。

  4. 分析ルールタイプで、カスタム を選択します。

  5. 新しい分析を確認するか、特定の共同作業者による分析を許可するを選択します。残りのステップは、特定の共同作業者による分析を許可するパスに従います。

  6. AWS アカウントの追加 を選択して、この設定済みテーブルで分析を送信できるパートナーを設定し、許可 AWS アカウント する を選択します。

  7. 分析結果コントロールを指定する - オプションで、集約しきい値を適用するにははいを選択します。

  8. 最小集計しきい値を設定します。

    1. ID 列を選択します。ID 列は、stringvarchar、または charタイプである必要があります。

    2. 最小 ID 数を指定します。サポートされている値は 2~100,000 です。

    3. 集計タイプCount distinct に事前設定されています。

  9. 集計関数でネストされた式を許可する の場合、デフォルトは No です。 このオプションをオフにすると、プライバシーが強化された設定になります。詳細については、「集計関数でネストされた式を許可する」を参照してください。

  10. (オプション) 出力列のオーバーライドを設定します。

    1. 列オーバーライドの追加 を選択します。

    2. ドロップダウンリストから出力列を選択します。

    3. 最小 ID 数を指定します。サポートされている値は0、列を最小集計から除外するか、2~100,000 の範囲から除外することです。

    詳細については、「特定の出力列の最小集計しきい値の上書き」を参照してください。

  11. (推奨) 比較できる列を設定します。

    1. デフォルトでは、すべての列が比較の対象となります。リテラルおよび列column-to-column比較に使用できる列を明示的に設定することは、プライバシーを強化した設定です。

    2. カスタムリストを選択します。

    3. リテラル比較に使用できる列を選択します。たとえば、 state列を許可すると、クエリランナーは などのリテラルフィルターを使用してクエリを実行できますWHERE state = 'New York'

    4. 列column-to-column比較に使用できる列を選択します。たとえば、 state列を許可すると、クエリランナーは などの列比較でクロステーブル結合を実行できますJOIN my_table t ON t.state = partner_table.state

    詳細については、「比較コントロール」を参照してください。

  12. [Next] (次へ) を選択します。

  13. [次へ] を選択します。差分プライバシーはオフになっており、最小集約しきい値または比較コントロールではサポートされていません。詳細については、「制限事項」を参照してください。

  14. カスタム分析ルール設定を確認します。

  15. [分析ルールを設定] を選択します。

  16. 設定済みテーブルをコラボレーションに関連付けます。詳細については、「ステップ 2: 設定済みテーブルを関連付ける」を参照してください。

考慮事項と制限事項

最小集約しきい値を使用する場合、考慮事項と制限が適用されます。利用できるタイムゾーンの一覧については、「考慮事項と制限事項」を参照してください。