翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。
最小集計しきい値
データ集約は、個人または小グループに関するクエリが結果を返さないようにすることで、匿名化を強制するのに役立つプライバシー強化手法です。テーブルに最小集約しきい値が設定されている場合、 はデータプロバイダーの指定された最小しきい値を満たさない結果を AWS Clean Rooms 抑制します。
集計しきい値
設定されたテーブルのカスタム分析ルールで最小集約しきい値を設定できます。データプロバイダーは、 identityColumnsと minimumIdentityCount、N を指定します。 でサポートされる値は 2~100,000 minimumIdentityCountです。identityColumns 値は、string、varchar、または charタイプである必要があります。最小集計しきい値は、SQL クエリ結果の各行に少なくとも N 個の個別のデータサブジェクトが含まれていることを保証します。がクエリフィルターとidentityColumnsやり取りする方法の詳細については、「」を参照してください比較コントロール。
次の例では、 をidentityColumns値user_idとして、最小集約しきい値を 100 に設定します。
{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT" } ] }
特定の出力列の最小集計しきい値の上書き
出力列の感度レベルは異なり、データプロバイダーは出力列に応じて異なるminimumIdentityCount値を適用できます。たとえば、 campaign_idは感度の低い列で、最小しきい値は 5 つの異なるデータサブジェクトですが、 postal_codeと は感度の高い列であるため、最小しきい値は 100 income_bracketになります。
列ごとのオーバーライドは、その出力列を最小集計から除外0する 、または 2~100,000 の値を受け入れます。
次の例では、 campaign_id列の最小集計しきい値オーバーライドを設定します。
{ "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] }
集計関数でネストされた式を許可する
集計関数内で式を許可すると、クリーンルームクエリでデータセットを再識別できるリスクが高まります。のデフォルト設定allowedAggregateExpressionTypeは でCOLUMNS_ONLY、プライバシー強化設定として推奨されます。この設定では、次のような集計関数内で列のみが受け入れられます。
-
SUM(コスト)
-
COUNT(DISTINCT campaign_id)
または、クエリランナーが信頼できるパートナーであるコラボレーションの場合は、集約関数ANY_EXPRESSION内で を許可できます。この設定により、 がデータに対して実行できる SQL クエリの柔軟性が向上しますが、クエリランナーは集計関数内で小さなグループを分離できるため、プライバシーリスクが生じます。
プライバシーとコンプライアンスのレビューが必要
集計関数ANY_EXPRESSION内で を許可する前に、プライバシー、セキュリティ、法務、コンプライアンスの各チームに相談して、これが組織の要件に準拠していることを確認してください。
以下は、一般的に安全と見なされる集計関数の式の例です。
-
SUM(コスト * 数量)
以下は、プライバシーリスクと見なされる集計関数の式の例です。
-
SUM(CASE WHEN zip_code = '10001' THEN給与 ELSE 0END)
以下は完全なaggregationThresholds例です。
{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT", "allowedAggregateExpressionType": "COLUMNS_ONLY", "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] } ] }
コンソールでの最小集約しきい値の設定
設定されたテーブルが存在した後、設定されたテーブルにカスタム分析ルールを追加する一環として、最小集計しきい値を設定します。完全なカスタム分析ルールガイド付きフローについては、「」を参照してくださいカスタム分析ルールのテーブルへの追加 (ガイドフロー)。
最小集計しきい値を設定するには
-
にサインイン AWS マネジメントコンソール し、https://console.aws.amazon.com/cleanrooms
で AWS Clean Rooms コンソールを開きます。 -
左側のナビゲーションペインで、テーブルを選択し、設定したテーブルを選択します。
-
設定済みテーブルの詳細ページで、[分析ルールを設定] を選択します。
-
分析ルールタイプで、カスタム を選択します。
-
新しい分析を確認するか、特定の共同作業者による分析を許可するを選択します。残りのステップは、特定の共同作業者による分析を許可するパスに従います。
-
AWS アカウントの追加 を選択して、この設定済みテーブルで分析を送信できるパートナーを設定し、許可 AWS アカウント する を選択します。
-
分析結果コントロールを指定する - オプションで、集約しきい値を適用するには、はいを選択します。
-
最小集計しきい値を設定します。
-
ID 列を選択します。ID 列は、
string、varchar、またはcharタイプである必要があります。 -
最小 ID 数を指定します。サポートされている値は 2~100,000 です。
-
集計タイプは Count distinct に事前設定されています。
-
-
集計関数でネストされた式を許可する の場合、デフォルトは No です。 このオプションをオフにすると、プライバシーが強化された設定になります。詳細については、「集計関数でネストされた式を許可する」を参照してください。
-
(オプション) 出力列のオーバーライドを設定します。
-
列オーバーライドの追加 を選択します。
-
ドロップダウンリストから出力列を選択します。
-
最小 ID 数を指定します。サポートされている値は
0、列を最小集計から除外するか、2~100,000 の範囲から除外することです。
詳細については、「特定の出力列の最小集計しきい値の上書き」を参照してください。
-
-
(推奨) 比較できる列を設定します。
-
デフォルトでは、すべての列が比較の対象となります。リテラルおよび列column-to-column比較に使用できる列を明示的に設定することは、プライバシーを強化した設定です。
-
カスタムリストを選択します。
-
リテラル比較に使用できる列を選択します。たとえば、
state列を許可すると、クエリランナーは などのリテラルフィルターを使用してクエリを実行できますWHERE state = 'New York'。 -
列column-to-column比較に使用できる列を選択します。たとえば、
state列を許可すると、クエリランナーは などの列比較でクロステーブル結合を実行できますJOIN my_table t ON t.state = partner_table.state。
詳細については、「比較コントロール」を参照してください。
-
-
[Next] (次へ) を選択します。
-
[次へ] を選択します。差分プライバシーはオフになっており、最小集約しきい値または比較コントロールではサポートされていません。詳細については、「制限事項」を参照してください。
-
カスタム分析ルール設定を確認します。
-
[分析ルールを設定] を選択します。
-
設定済みテーブルをコラボレーションに関連付けます。詳細については、「ステップ 2: 設定済みテーブルを関連付ける」を参照してください。
考慮事項と制限事項
最小集約しきい値を使用する場合、考慮事項と制限が適用されます。利用できるタイムゾーンの一覧については、「考慮事項と制限事項」を参照してください。