View a markdown version of this page

最低聚合阈值 - AWS Clean Rooms

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

最低聚合阈值

数据聚合是一种增强隐私的技术,它通过防止查询返回有关个人或小群体的结果来帮助强制匿名化。在表上配置了最小聚合阈值时,会 AWS Clean Rooms 抑制不符合数据提供者指定的最小阈值的结果。

聚合阈值

您可以在自定义分析规则中为配置的表配置最小聚合阈值。数据提供者指定identityColumnsminimumIdentityCount,N。支持的值介于 minimumIdentityCount 2 到 100,000 之间。该identityColumns值必须是stringvarchar、或char类型。最低聚合阈值可确保 SQL 查询结果中的每一行至少有 N 个不同的数据主体参与其中。有关如何与查询过滤器identityColumns交互的信息,请参阅比较控件

以下示例将最小聚合阈值设置为 100user_id,并将其作为identityColumns值:

{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT" } ] }

覆盖特定输出列的最小聚合阈值

输出列具有不同的敏感度级别,数据提供者可以根据输出列强制执行不同的minimumIdentityCount值。例如,campaign_id可能是低敏感度列,其最小阈值为 5 个不同的数据主体,postal_codeincome_bracket由于它们是高敏感度列,因此其最低阈值为 100。

每列覆盖接受0,这使该输出列免于最小聚合,或介于 2 到 100,000 之间的值。

以下示例为该campaign_id列设置了最低聚合阈值覆盖:

{ "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] }

允许在聚合函数中嵌套表达式

允许在聚合函数内使用表达式会增加在无尘室查询中重新识别数据主体的风险。的默认设置allowedAggregateExpressionTypeCOLUMNS_ONLY,建议将其作为隐私增强配置。使用此设置,聚合函数中仅接受列,例如:

  • SUM(成本)

  • COUNT(DISTINCTcampaign_id)

或者,对于查询运行器是可信合作伙伴的协作,您可以允许ANY_EXPRESSION在聚合函数内部。此设置提高了可在您的数据上运行的 SQL 查询的灵活性,但会带来隐私风险,因为查询运行器可以在聚合函数中隔离小组。

需要进行隐私和合规审查

在允许ANY_EXPRESSION内部聚合职能部门之前,请咨询您的隐私、安全、法律和合规团队,以确保这符合您组织的要求。

以下是聚合函数中通常被认为安全的表达式的示例:

  • SUM(成本 * 数量)

以下是聚合函数中被视为隐私风险的表达式示例:

  • SUM(CASEWHENzip_code = '10001' THEN 工资 0) ELSE END

以下是一个完整的aggregationThresholds示例:

{ "aggregationThresholds": [ { "identityColumns": [ "user_id" ], "minimumIdentityCount": 100, "type": "COUNT_DISTINCT", "allowedAggregateExpressionType": "COLUMNS_ONLY", "outputColumnThresholds": [ { "outputColumnName": "campaign_id", "minimumIdentityCount": 5 } ] } ] }

在控制台中配置最低聚合阈值

在配置的表存在之后,您可以将最小聚合阈值配置为向配置表添加自定义分析规则的一部分。有关完整的自定义分析规则指导流程,请参阅为表添加自定义分析规则(引导流程)

配置最低聚合阈值
  1. 登录 AWS 管理控制台 并打开 AWS Clean Rooms 控制台,地址为https://console.aws.amazon.com/cleanrooms

  2. 在左侧导航窗格中,选择 “表”,然后选择您配置的表。

  3. 在配置表详细信息页面上,选择配置分析规则

  4. 对于分析规则类型,选择自定义

  5. 选择 “查看每项新分析” 或 “允许特定合作者进行任何分析”。其余步骤遵循 “允许特定合作者进行任何分析” 路径。

  6. 选择添加 AWS 账户以配置哪些合作伙伴可以在此配置表上提交分析,然后选择 AWS 账户 允许。

  7. “指定分析结果控件-可选” 中,对于 “强制执行聚合阈值?”,选择 “是”

  8. 配置最低聚合阈值。

    1. 选择您的身份列。标识列必须为stringvarchar、或char类型。

    2. 指定您的最低身份人数。支持的值介于 2 到 100,000 之间。

    3. 聚合类型已预先配置为不重复计数。

  9. 对于允许在聚合函数中嵌套表达式?,默认为 “否” 。关闭此选项是隐私增强配置。有关更多信息,请参阅 允许在聚合函数中嵌套表达式

  10. (可选)配置输出列覆盖。

    1. 选择 “添加列覆盖”

    2. 从下拉列表中选择您的输出列。

    3. 指定您的最低身份人数。支持的值是0免除该列的最小聚合值,或介于 2 到 100,000 之间。

    有关更多信息,请参阅 覆盖特定输出列的最小聚合阈值

  11. (推荐)配置允许比较的列。

    1. 默认情况下,所有列都有资格进行比较。明确配置允许对哪些列进行文字和列间比较是增强隐私的配置。

    2. 选择 “自定义列表”

    3. 选择允许对哪些列进行文字比较。例如,允许该state列允许查询运行器使用文字过滤器运行查询,例如WHERE state = 'New York'

    4. 选择哪些列可用于列与列的比较。例如,允许该state列允许查询运行器通过列比较来运行跨表联接,例如JOIN my_table t ON t.state = partner_table.state

    有关更多信息,请参阅 比较控件

  12. 选择下一步

  13. 选择下一步。差分隐私已关闭,不支持最低聚合阈值或比较控件。有关更多信息,请参阅 限制

  14. 查看您的自定义分析规则配置。

  15. 选择配置分析规则

  16. 将配置的表关联到协作。有关更多信息,请参阅 步骤 2:关联已配置的表

注意事项和限制

使用最低聚合阈值时,需要注意事项和限制。完整列表请参阅 注意事项和限制