View a markdown version of this page

Coincidencia de los datos de entrada mediante un flujo de trabajo de coincidencias - AWS Entity Resolution

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Coincidencia de los datos de entrada mediante un flujo de trabajo de coincidencias

Un flujo de trabajo coincidente es un trabajo de procesamiento de datos que combina y compara datos de diferentes fuentes de entrada y determina qué registros coinciden basándose en diferentes técnicas de coincidencia. AWS Entity Resolution lee los datos de las ubicaciones especificadas, busca coincidencias entre registros y asigna un identificador de coincidencia a cada conjunto de datos coincidentes.

El siguiente diagrama resume cómo crear un flujo de trabajo coincidente.

A summary of the four steps to create a matching workflow in AWS Entity Resolution

Tipos de flujo de trabajo coincidentes

AWS Entity Resolution admite tres tipos de flujos de trabajo coincidentes:

Rule-based coincidencia

Utiliza reglas configurables para identificar los registros coincidentes basándose en la coincidencia exacta o difusa de los campos especificados. Usted define los criterios de coincidencia, como los nombres coincidentes que se escriben de manera similar o las direcciones que tienen un formato diferente.

Coincidencias basadas en machine learning

Utiliza modelos de aprendizaje automático para identificar registros similares, incluso cuando los datos tienen variaciones, errores o faltan campos. Este enfoque puede detectar coincidencias más complejas que las coincidencias basadas en reglas.

Comparación basada en el servicio del proveedor

Utiliza proveedores de datos de terceros para enriquecer y validar sus datos antes de compararlos. Este tipo de coincidencia no es compatible con la salida de los perfiles de clientes de Connect Customer.

Opciones de salida de datos

AWS Entity Resolution puede escribir archivos de salida de datos en:

  • Una ubicación de Amazon S3 que usted especifique

  • Conecte los perfiles de los clientes (para la deduplicación de datos de los clientes)

importante

La exportación a los perfiles de clientes de Connect no es compatible con la comparación basada en el proveedor. Para exportar a los perfiles de clientes de Connect, debe utilizar la comparación basada en reglas o el aprendizaje automático.

Si lo deseas, puedes AWS Entity Resolution usar el método hash de los datos de salida, lo que te ayudará a mantener el control sobre tus datos.

La siguiente tabla muestra los tres tipos de flujos de trabajo coincidentes y sus destinos de salida compatibles.

Tipo coincidente salidas S3 Salida de perfiles de clientes
basado en reglas
basado en aprendizaje automático
basado en servicios de proveedores No

Resultados de flujo de trabajo coincidentes

Tras crear y ejecutar un flujo de trabajo coincidente, puede ver los resultados en la ubicación de S3 que haya especificado o en los perfiles de clientes de Connect Customer. Los flujos de trabajo coincidentes generan ID después de indexar los datos.

Un flujo de trabajo coincidente puede tener varias ejecuciones y los resultados (éxitos o errores) se escriben en una carpeta con jobId el nombre.

Para cada ejecución para los destinos de salida de S3:

  • La salida de datos contiene tanto un archivo para las coincidencias satisfactorias como un archivo para los errores

  • Los resultados correctos se escriben en una success carpeta que contiene varios archivos

  • Los errores se escriben en una error carpeta con varios campos

Para cada destino de salida de los perfiles de clientes de Connect Customer:

  • Los registros de clientes deduplicados se envían directamente a su instancia de Connect Customer

  • Puedes ver tu historial de trabajos recientes en la consola AWS Entity Resolution

  • Los perfiles existentes en Connect Customer no se incluyen en el proceso de deduplicación

Después de crear y ejecutar un flujo de trabajo coincidente, puede usar el resultado de la comparación basada en reglas o mediante aprendizaje automático (ML) como entrada para la comparación basada en el servicio del proveedor o viceversa para satisfacer las necesidades de su empresa.

Por ejemplo, para ahorrar costos de suscripción a los proveedores, primero puedes buscar coincidencias basadas en reglas para encontrar coincidencias en tus datos. A continuación, puede enviar un subconjunto de registros no coincidentes a la búsqueda de coincidencias basada en el servicio del proveedor. Crear un flujo de trabajo coincidente basado en el servicio del proveedor Tenga en cuenta que si planea exportar a perfiles de clientes, debe utilizar únicamente la búsqueda de coincidencias basada en reglas o en aprendizaje automático.

Para obtener más información sobre la solución de errores, consulte. Solución de problemas de flujos de trabajo