本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
中的中间表 AWS Clean Rooms
中间表是一种协作范围的资源,用于在协作中缓存分析结果 AWS Clean Rooms ,以便在后续分析中重复使用。
中间表由拥有和管理中间表的分析运行者创建。数据存储在 AWS 托管存储中,不会在协作之外导出。
在分析中使用中间表之前,必须先对其进行填充。然后,为其附加自定义分析规则。该表的状态必须为,POPULATE_SUCCESS然后才能在任何分析中被引用。您可以在 SQL 查询和 PySpark 作业中按名称引用中间表,就像配置的表一样。
注意
中间表的存储按标准费率计费,直到该表被删除。
基表是分析中用于填充中间表的任何已配置表、ID 映射表或其他中间表。
延期执行
AWS Clean Rooms 对中间表的某些隐私控制使用延期强制执行。 AWS Clean Rooms 在创建或填充中间表时不评估延迟控件。而是在分析时 AWS Clean Rooms 强制执行它们,即在后续分析中引用中间表时。
中间表具有以下分类类型,这些类型决定了延迟控制的应用方式:
-
First-party— 用于填充中间表的所有基表均归创建者所有。创建者可以完全控制分析规则的配置。
-
Multi-party— 基表来自不同的数据提供者。创建者只能使继承的控件更严格,而不是更少。
中间表继承了用于填充它的基表的延迟控件。填充中间表时,会从每个基表的分析规则中 AWS Clean Rooms 捕获延迟控件。然后,它将最严格的组合应用于中间表。
下表描述了中间表的延迟控件。
| 延期控制 | 说明 |
|---|---|
| 允许的结果接收器 | 指定哪些协作成员可以接收引用中间表的分析结果。继承为所有基表允许的结果接收器的交集。 |
| 不允许的输出列 | 指定无法出现在分析输出中的列。继承为所有基表不允许的输出列的并集。 |
| 允许的其他分析 | 指定分析结果是否可用作其他分析的输入。继承为基表中限制性最强的值。 |
| 其他分析 | 控制是否可以在初始分析之外的其他分析中使用中间表。继承为基表中限制性最强的值。 |
中间表状态
下表描述了中间表的状态生命周期。
| Status | 说明 |
|---|---|
CREATED |
中间表资源存在但没有物化数据。 |
POPULATE_STARTED |
填充操作正在进行中。 |
POPULATE_SUCCESS |
已在中间表中成功实现数据。 |
POPULATE_FAILED |
填充操作未成功完成。 |
DISALLOWED_BY_DATA_PROVIDER |
数据提供者已禁止使用中间表。在数据提供者重新允许使用该表之前,该表不能再用于分析。 |
BASE_TABLE_REMOVED |
用于填充中间表的一个或多个基表已从协作中移除。中间表不能再用于分析。 |
RETENTION_PERIOD_EXPIRED |
根据配置的保留期,中间表版本已过期。所有存储的数据都已清理,必须重新填充表才能再次使用。默认保留期为 30 天。 |
带有中间表格的预算
您可以在中间表上配置访问预算和差异隐私预算,就像配置的表一样。
访问预算
AWS Clean Rooms 在以下时间减少中间表和分析中引用的所有基表(包括嵌套中间表的传递依赖关系)的访问预算:
-
创建或刷新-由于填充操作会对基表执行分析,因此预算会减少。
-
使用量-由于中间表包含基表数据,因此预算会减少。每次访问该数据,即使已缓存,也算作使用基表进行隐私跟踪。
差异性隐私预算
AWS Clean Rooms 按如下方式处理中间表的差异隐私预算:
-
创建或刷新-如果基表启用了差异隐私,则其差异隐私预算会减少。 AWS Clean Rooms 此时会注入噪音。对于启用了差异隐私的查询,填充中间表的分析必须遵循所有限制。
-
用法 — 如果您为中间表配置了差异隐私,则协作的单一预算所有者的 epsilon 会减少。无论谁拥有中间表,这都适用。如果不存在预算,则分析将被拒绝。
注意
中间表上的差异隐私将中间表中的数据视为新的数据集。 AWS Clean Rooms 根据中间表本身的用户数量注入噪音。如果您在填充中间表时通过转换放大了用户数量,则不会跟踪该转换对原始用户群的影响。