本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
使用匹配流程匹配输入数据
匹配工作流程是一种数据处理作业,它合并和比较来自不同输入源的数据,并根据不同的匹配技术确定哪些记录匹配。 AWS Entity Resolution 数据匹配服务 从您的指定位置读取数据,查找记录之间的匹配项,并为每组匹配的数据分配匹配 Match ID 。
下图总结了如何创建匹配的工作流程。
主题
匹配工作流程类型
AWS Entity Resolution 数据匹配服务 支持三种类型的匹配工作流程:
- Rule-based 匹配
-
使用可配置的规则,根据指定字段的精确或模糊匹配来识别匹配记录。您可以定义匹配标准,例如匹配拼写相似的名称或格式不同的地址。
- 基于机器学习的匹配
-
使用机器学习模型来识别相似的记录,即使数据有变体、错误或缺失字段也是如此。与基于规则的匹配相比,这种方法可以检测到更复杂的匹配项。
- 基于提供商服务的匹配
-
在匹配之前,使用第三方数据提供商来丰富和验证您的数据。这种类型的匹配与 Connect 客户档案输出不兼容。
数据输出选项
AWS Entity Resolution 数据匹配服务 可以将数据输出文件写入:
-
您指定的 Amazon S3 位置
-
连接客户客户档案(用于客户重复数据消除)
重要
导出到 Connect 客户档案与基于提供商的匹配不兼容。要导出到 Connect 客户档案,必须使用基于规则的匹配或基于机器学习的匹配。
如果需要 AWS Entity Resolution 数据匹配服务 ,您可以使用对输出数据进行哈希处理,从而帮助您保持对数据的控制。
下表显示了三种类型的匹配工作流及其支持的输出目的地。
匹配工作流程结果
创建并运行匹配的工作流程后,您可以在指定的 S3 位置或 Connect 客户档案中查看结果。对数据进行索引后,匹配工作流程会生成 ID。
匹配的工作流程可以进行多次运行,并将结果(成功或错误)写入一个名jobId为的文件夹。
对于每次运行 S3 输出目的地:
-
数据输出包含成功匹配的文件和错误的文件
-
成功的结果将写入包含多个文件的文件
success夹 -
错误被写入具有多个字段的
error文件夹
对于每次运行 Connect 客户档案的输出目的地:
-
消除重复数据的客户记录将直接发送到您的 Connect 客户实例
-
你可以在 AWS Entity Resolution 数据匹配服务 控制台中查看你最近的任务历史记录
-
Connect Customer 中的现有配置文件不包含在重复数据删除过程中
创建并运行匹配工作流程后,您可以使用基于规则的匹配或机器学习 (ML) 匹配的输出作为提供商基于服务的匹配的输入,或者反过来满足您的业务需求。
例如,为了节省提供商的订阅成本,您可以先运行基于规则的匹配来查找数据上的匹配项。然后,您可以将一部分不匹配的记录发送到提供商基于服务的匹配中。请注意,如果您计划导出到客户档案,则应仅使用基于规则或基于机器学习的匹配。
有关故障排除的更多信息,请参阅匹配工作流程疑难解答。