View a markdown version of this page

使用匹配流程匹配输入数据 - AWS Entity Resolution 数据匹配服务

本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。

使用匹配流程匹配输入数据

匹配工作流程是一种数据处理作业,它合并和比较来自不同输入源的数据,并根据不同的匹配技术确定哪些记录匹配。 AWS Entity Resolution 数据匹配服务 从您的指定位置读取数据,查找记录之间的匹配项,并为每组匹配的数据分配匹配 Match ID

下图总结了如何创建匹配的工作流程。

A summary of the four steps to create a matching workflow in AWS Entity Resolution 数据匹配服务

匹配工作流程类型

AWS Entity Resolution 数据匹配服务 支持三种类型的匹配工作流程:

Rule-based 匹配

使用可配置的规则,根据指定字段的精确或模糊匹配来识别匹配记录。您可以定义匹配标准,例如匹配拼写相似的名称或格式不同的地址。

基于机器学习的匹配

使用机器学习模型来识别相似的记录,即使数据有变体、错误或缺失字段也是如此。与基于规则的匹配相比,这种方法可以检测到更复杂的匹配项。

基于提供商服务的匹配

在匹配之前,使用第三方数据提供商来丰富和验证您的数据。这种类型的匹配与 Connect 客户档案输出不兼容。

数据输出选项

AWS Entity Resolution 数据匹配服务 可以将数据输出文件写入:

  • 您指定的 Amazon S3 位置

  • 连接客户客户档案(用于客户重复数据消除)

重要

导出到 Connect 客户档案与基于提供商的匹配不兼容。要导出到 Connect 客户档案,必须使用基于规则的匹配或基于机器学习的匹配。

如果需要 AWS Entity Resolution 数据匹配服务 ,您可以使用对输出数据进行哈希处理,从而帮助您保持对数据的控制。

下表显示了三种类型的匹配工作流及其支持的输出目的地。

匹配类型 S3 输出 客户档案输出
基于规则
基于机器学习
基于提供商服务

匹配工作流程结果

创建并运行匹配的工作流程后,您可以在指定的 S3 位置或 Connect 客户档案中查看结果。对数据进行索引后,匹配工作流程会生成 ID。

匹配的工作流程可以进行多次运行,并将结果(成功或错误)写入一个名jobId为的文件夹。

对于每次运行 S3 输出目的地:

  • 数据输出包含成功匹配的文件和错误的文件

  • 成功的结果将写入包含多个文件的文件success

  • 错误被写入具有多个字段的error文件夹

对于每次运行 Connect 客户档案的输出目的地:

  • 消除重复数据的客户记录将直接发送到您的 Connect 客户实例

  • 你可以在 AWS Entity Resolution 数据匹配服务 控制台中查看你最近的任务历史记录

  • Connect Customer 中的现有配置文件不包含在重复数据删除过程中

创建并运行匹配工作流程后,您可以使用基于规则的匹配机器学习 (ML) 匹配的输出作为提供商基于服务的匹配的输入,或者反过来满足您的业务需求。

例如,为了节省提供商的订阅成本,您可以先运行基于规则的匹配来查找数据上的匹配项。然后,您可以将一部分不匹配的记录发送到提供商基于服务的匹配中。请注意,如果您计划导出到客户档案,则应仅使用基于规则或基于机器学习的匹配。

有关故障排除的更多信息,请参阅匹配工作流程疑难解答