View a markdown version of this page

AWS Entity Resolution Glosario - AWS Entity Resolution

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

AWS Entity Resolution Glosario

Nombre de recurso de Amazon (ARN)

Un identificador único para AWS los recursos. Los ARN son obligatorios cuando es necesario especificar un recurso de forma inequívoca para todos ellos AWS Entity Resolution, como en las AWS Entity Resolution políticas, las etiquetas de Amazon Relational Database Service (Amazon RDS) y las llamadas a la API.

Tipo de atributo

El tipo de atributo del campo de entrada. Al crear una asignación de esquemas, selecciona el tipo de atributo de una lista preconfigurada de valores, como el nombre, la dirección, el número de teléfono o la dirección de correo electrónico. El tipo de atributo indica AWS Entity Resolution qué tipo de datos se presentan, lo que permite clasificarlos y normalizarlos correctamente.

Procesamiento automático

Una opción de cadencia de procesamiento para un trabajo de flujo de trabajo coincidente que permite ejecutarlo automáticamente cuando cambia la entrada de datos.

Esta opción solo está disponible para la coincidencia basada en reglas.

De forma predeterminada, la cadencia de procesamiento de un trabajo de flujo de trabajo coincidente se establece en Manual , lo que permite ejecutarlo bajo demanda. Puede configurar el procesamiento automático para ejecutar automáticamente el trabajo de flujo de trabajo correspondiente cuando cambie la entrada de datos. De este modo, se mantiene actualizado el resultado del flujo de trabajo correspondiente.

AWS KMS key ARN

Este es su nombre de recurso de AWS KMS Amazon (ARN) para el cifrado en reposo. Si no se proporciona, el sistema utilizará una clave de KMS AWS Entity Resolution gestionada.

Flujo de trabajo por lotes

Un proceso que se ejecuta a intervalos programados para hacer coincidir y resolver los datos de todo un conjunto de datos. Los flujos de trabajo por lotes se AWS Entity Resolution utilizan mejor para la configuración inicial, las actualizaciones completas periódicas y los escenarios con cambios significativos en los conjuntos de datos de origen y de destino.

Texto sin cifrar

Datos que no están protegidos criptográficamente.

Nivel de confianza () ConfidenceLevel

En el caso de la coincidencia de ML, este es el nivel de confianza que se aplica AWS Entity Resolution cuando ML identifica un conjunto de registros coincidente. Esto forma parte de los metadatos del flujo de trabajo coincidentes que se incluirán en la salida.

Nivel de confianza récord (RecordConfidenceLevel)

En el caso de las coincidencias incrementales de ML, este es el nivel de confianza por registro que se aplica AWS Entity Resolution cuando ML identifica un conjunto de registros coincidente. Esto forma parte de los metadatos del flujo de trabajo coincidentes que se incluirán en la salida.

Descifrado

El proceso de transformar los datos cifrados para devolverles su forma original. El descifrado solo se puede realizar si se tiene el acceso a la clave secreta.

Cifrado

Proceso de codificación de datos en un formato aparentemente aleatorio utilizando un valor secreto denominado clave. Es imposible determinar el texto sin formato original sin tener acceso a la clave.

Nombre del grupo

El nombre del grupo hace referencia a todo el grupo de campos de entrada y puede ayudarle a agrupar los datos analizados para que coincidan.

Por ejemplo, si hay tres campos de entrada:first_name,middle_name, ylast_name, puede agruparlos introduciendo el nombre del grupo full_name para establecer la coincidencia y la salida.

Hash

El hashing consiste en aplicar un algoritmo criptográfico que produce una cadena única e irreversible de caracteres de un tamaño fijo, lo que se denomina hash. AWS Entity Resolution utiliza el protocolo hash Secure Hash Algorithm de 256 bits (SHA256) y generará una cadena de caracteres de 32 bytes. En AWS Entity Resolution, puede elegir si desea aplicar un hash a los valores de los datos de salida.

Protocolo de hash (HashingProtocol)

AWS Entity Resolution utiliza el protocolo hash Secure Hash Algorithm de 256 bits (SHA256) y generará una cadena de caracteres de 32 bytes. Esto forma parte de los metadatos del flujo de trabajo coincidentes que se incluirán en la salida.

Método de asignación de ID

Cómo desea que se realice la asignación de ID.

Hay dos métodos de mapeo de ID:

  • Rule-based — El método mediante el cual se utilizan reglas de coincidencia para traducir datos propios de un origen a un destino en un flujo de trabajo de mapeo de ID.

  • Servicios de proveedor: método mediante el cual se utiliza un servicio de proveedor para traducir datos codificados por terceros de un origen a un destino en un flujo de trabajo de mapeo de ID.

    AWS Entity Resolution actualmente es compatible LiveRamp como método de mapeo de ID basado en los servicios del proveedor. Debe tener una suscripción completa LiveRamp AWS Data Exchange para utilizar este método. Para obtener más información, consulte Paso 1: Suscríbase a un servicio de proveedor en AWS Data Exchange.

Flujo de trabajo de asignación de ID

Un trabajo de procesamiento de datos que asigna datos de una fuente de datos de entrada a un destino de datos de entrada en función del método de asignación de ID especificado. Produce una tabla de asignación de ID. Este flujo de trabajo requiere que especifique el método de asignación de ID y los datos de entrada que desea traducir de una fuente a un destino.

Puedes configurar un flujo de trabajo de mapeo de ID para que se ejecute por tu cuenta Cuenta de AWS o entre dos Cuentas de AWS.

Espacio de nombres de ID

Un recurso AWS Entity Resolution que contiene metadatos que explican los conjuntos de datos de varios conjuntos de datos Cuentas de AWS y cómo utilizar estos conjuntos de datos en un flujo de trabajo de mapeo de identidades.

Hay dos tipos de espacios de nombres de ID: y. SOURCE TARGET SOURCEContiene configuraciones para los datos de origen que se procesarán en un flujo de trabajo de mapeo de ID. TARGETContiene una configuración de los datos de destino a la que responderán todas las fuentes. Para definir los datos de entrada que desea resolver en dos Cuentas de AWS, cree una fuente de espacio de nombres de ID y un destino de espacio de nombres de ID para traducir los datos de un conjunto (SOURCE) a otro (). TARGET

Después de que tú y otro miembro creéis espacios de nombres de ID y ejecutéis un flujo de trabajo de asignación de ID, podéis uniros a una colaboración AWS Clean Rooms para ejecutar una unión de varias tablas en la tabla de asignación de ID y analizar los datos.

Para obtener más información, consulte la Guía del usuario de AWS Clean Rooms.

Flujo de trabajo incremental

Un proceso que solo encuentra y resuelve los registros nuevos o actualizados desde la última ejecución, en lugar de procesar todo el conjunto de datos. Los flujos de trabajo incrementales se AWS Entity Resolution utilizan mejor para las actualizaciones frecuentes a fin de mantener la frescura de los datos cuando solo ha cambiado una pequeña parte del conjunto de datos.

Campo de entrada

Un campo de entrada corresponde al nombre de una columna de la tabla AWS Glue de datos de entrada.

Fuente de entrada ARN (InputSourceARN)

El nombre de recurso de Amazon (ARN) que se generó para la entrada de una AWS Glue tabla. Esto forma parte de los metadatos del flujo de trabajo coincidentes que se incluirán en la salida.

Coincidencias basadas en machine learning

La coincidencia basada en el aprendizaje automático (coincidencia de aprendizaje automático) busca coincidencias en los datos que pueden estar incompletas o no tener exactamente el mismo aspecto. La comparación automática es un proceso preestablecido que intentará hacer coincidir los registros de todos los datos que ingreses. La coincidencia de ML devuelve un identificador de coincidencia y un nivel de confianza para cada conjunto de datos coincidente.

Procesamiento manual

Una opción de cadencia de procesamiento para un trabajo de flujo de trabajo coincidente que permite ejecutarlo bajo demanda.

Esta opción está configurada de forma predeterminada y está disponible tanto para la coincidencia basada en reglas como para la comparación basada en el aprendizaje automático.

Many-to-Many coincidencia

Many-to-many la coincidencia compara varias instancias de datos similares. Los valores de los campos de entrada a los que se haya asignado la misma clave de coincidencia se compararán entre sí, independientemente de si están en el mismo campo de entrada o en campos de entrada diferentes.

Por ejemplo, es posible que tenga varios campos de entrada de números de teléfono como «Teléfono» mobile_phone y home_phone que tengan la misma tecla de coincidencia. Usa la coincidencia de varios a varios para comparar los datos del campo mobile_phone de entrada con los datos del campo mobile_phone de entrada y los datos del campo home_phone de entrada.

Las reglas de coincidencia evalúan los datos de varios campos de entrada con la misma clave de coincidencia en una operación (o), y las coincidencias de uno a varios comparan los valores de varios campos de entrada. Esto significa que si hay una combinación mobile_phone o una home_phone coincidencia entre dos registros, la clave de coincidencia «Teléfono» devolverá una coincidencia. Para encontrar una coincidencia con la tecla «Teléfono», Record One mobile_phone = Record Two mobile_phone OR Record One mobile_phone = Record Two home_phone OR Record One home_phone = Record Two home_phone ORRecord One home_phone = Record Two mobile_phone.

ID de coincidencia (MatchID)

Para la coincidencia basada en reglas y la coincidencia de ML, este es el ID generado AWS Entity Resolution y aplicado a cada conjunto de registros coincidente. Forma parte de los metadatos del flujo de trabajo coincidentes que se incluirán en la salida.

Clave de coincidencia (MatchKey)

La clave de coincidencia indica AWS Entity Resolution qué campos de entrada se deben considerar como datos similares y cuáles se deben considerar como datos diferentes. Esto ayuda a configurar AWS Entity Resolution automáticamente las reglas de coincidencia basadas en reglas y a comparar datos similares almacenados en diferentes campos de entrada.

Si hay varios tipos de información sobre el número de teléfono, como un campo de mobile_phone entrada y home_phone otro campo de entrada en tus datos, que te gustaría comparar entre sí, puedes asignarles a ambos la tecla correspondiente «Teléfono». A continuación, se puede configurar la coincidencia basada en reglas para comparar los datos utilizando las sentencias «o» en todos los campos de entrada con la tecla de coincidencia «Teléfono» (consulte la sección Concordancia y Many-to-Many definiciones One-to-One coincidentes en la sección Flujo de trabajo coincidente).

Si quieres que la coincidencia basada en reglas considere los distintos tipos de información de números de teléfono de forma completamente separada, puedes crear claves de coincidencia más específicas, como «Mobile_Phone» y «». Home_Phone Luego, al configurar un flujo de trabajo de coincidencia, puedes especificar cómo se usará cada clave de coincidencia telefónica en la coincidencia basada en reglas.

Si no MatchKey se especifica ningún campo de entrada en particular, no se puede usar para hacer coincidir, pero se puede llevar a cabo durante el proceso de búsqueda de coincidencias y se puede generar si se desea.

Nombre de clave de coincidencia

El nombre asignado a una clave de coincidencia.

Regla de coincidencia (MatchRule)

En el caso de las coincidencias basadas en reglas, este es el número de regla aplicado que generó un conjunto de registros coincidentes. Esto forma parte de los metadatos del flujo de trabajo coincidentes que se incluirán en la salida.

Coincidencia

Proceso de combinar y comparar datos de diferentes campos de entrada, tablas o bases de datos y determinar cuáles son iguales (o «coinciden») en función del cumplimiento de ciertos criterios de coincidencia (por ejemplo, mediante reglas o modelos de coincidencia).

Flujo de trabajo correspondiente

El proceso que se configura para especificar los datos de entrada que deben compararse y cómo se debe realizar la comparación.

Descripción del flujo de trabajo coincidente

Una descripción opcional del flujo de trabajo coincidente que puede elegir introducir. Las descripciones le ayudan a diferenciar entre los flujos de trabajo coincidentes si crea más de uno.

Nombre del flujo de trabajo coincidente

El nombre del flujo de trabajo coincidente que especifique.

nota

Los nombres de los flujos de trabajo coincidentes deben ser únicos. No pueden tener el mismo nombre o se generará un error.

Metadatos de flujo de trabajo

Información generada y generada AWS Entity Resolution durante un trabajo de flujo de trabajo coincidente. Esta información es obligatoria en la salida.

Normalización (ApplyNormalization)

Elija si desea normalizar los datos de entrada según lo definido en el esquema. La normalización estandariza los datos eliminando los espacios adicionales y los caracteres especiales y estandarizando el formato en minúsculas.

Por ejemplo, si un campo de entrada tiene el tipo de atributo Teléfono Teléfono completo y los valores de la tabla de entrada tienen el mismo formato(123) 456-7890, los valores se AWS Entity Resolution normalizarán a. 1234567890

nota

La normalización solo es compatible con el tipo de grupo: nombre, dirección , teléfono y correo electrónico.

En las siguientes secciones se describen nuestras reglas de normalización estándar.

Para ver una ML-based coincidencia específica, consulteNormalización ()ApplyNormalization: solo ML-based.

Name

nota

La normalización solo se admite para el tipo de grupo de nombres.

El tipo de grupo de nombres aparece como Nombre completo en la consola y como NAME en la API.

Si desea normalizar los subtipos del grupo de nombres, escriba:

  • En la consola, asigne los siguientes subtipos al grupo Nombre completo: nombre, segundo nombre y apellido.

  • En la CreateSchemaMapping API, asigne los siguientes tipos al NAME nombre del grupo: NAME_FIRSTNAME_MIDDLE, y. NAME_LAST

  • TRIM = Recorta los espacios en blanco iniciales y finales

  • LOWERCASE = Pondrá en minúscula todos los caracteres alfabéticos

  • CONVERT_ACCENT = Convierte una letra acentuada a una letra normal

  • REMOVE_ALL_NON_ALPHA = Elimina todos los caracteres no alfabéticos [a-z] A-Z

Correo electrónico

nota

Se admite la normalización para el tipo de grupo de correo electrónico.

El tipo de grupo de correo electrónico aparece como dirección de correo electrónico en la consola y como EMAIL_ADDRESS en la API.

  • TRIM = Recorta los espacios en blanco iniciales y finales

  • LOWERCASE = Pondrá en minúscula todos los caracteres alfabéticos

  • CONVERT_ACCENT = Convierte una letra acentuada a una letra normal

  • EMAIL_ADDRESS_UTIL_NORM = Elimina los puntos (.) del nombre de usuario, elimina todo lo que esté después del signo más (+) en el nombre de usuario y estandariza las variaciones de dominio más comunes

  • REMOVE_ALL_NON_EMAIL_CHARS = Elimina todos los caracteres no alfanuméricos [a-z] y [.@-] A-Z0-9

Teléfono

nota

La normalización solo es compatible con el tipo de grupo telefónico.

El tipo de grupo telefónico aparece como Teléfono completo en la consola y como PHONE en la API.

Si quieres normalizar los subtipos del tipo de grupo telefónico:

  • En la consola, asigne los siguientes subtipos al grupo telefónico completo: número de teléfono y código de país del teléfono.

  • En la CreateSchemaMapping API, asigne los siguientes tipos al PHONE nombre del grupo: PHONE_NUMBER y. PHONE_COUNTRYCODE

  • TRIM = Recorta los espacios en blanco iniciales y finales

  • REMOVE_ALL_NON_NUMERIC = Elimina todos los caracteres no numéricos [0-9]

  • REMOVE_ALL_LEADING_ZEROES = Elimina todos los ceros iniciales

  • ENSURE_PREFIX_WITH_MAP, «phone» = Examina cada número de teléfono e intenta compararlo con los patrones del teléfono. PrefixMap PrefixMap Si se encuentra una coincidencia, la regla agregará o modificará el prefijo del número de teléfono para garantizar que se ajusta al formato estandarizado especificado en el mapa.

Dirección

nota

La normalización solo se admite para el tipo de grupo de direcciones.

El tipo de grupo de direcciones aparece como Dirección completa en la consola y como ADDRESS en la API.

Si desea normalizar los subtipos del grupo de direcciones, escriba:

  • En la consola, asigne los siguientes subtipos al grupo de direcciones completo: dirección postal 1, dirección 2: nombre de la dirección 3, nombre de la ciudad, estado , país y código postal t

  • En la CreateSchemaMapping API, asigne los siguientes tipos al ADDRESS nombre del grupo:ADDRESS_STREET1,ADDRESS_STREET2,ADDRESS_STREET3, ADDRESS_CITY ADDRESS_STATEADDRESS_COUNTRY, y. ADDRESS_POSTALCODE

  • TRIM = Recorta los espacios en blanco iniciales y finales

  • LOWERCASE = Pondrá en minúscula todos los caracteres alfabéticos

  • CONVERT_ACCENT = Convierte una letra acentuada a una letra normal

  • REMOVE_ALL_NON_ALPHA = Elimina todos los caracteres no alfabéticos [a-z] A-Z

  • RENAME_WORDS usando ADDRESS_RENAME_WORD_MAP = reemplaza las palabras de la cadena de direcciones por palabras de ADDRESS_RENAME_WORD_MAP ADDRESS_RENAME_WORD_MAP

  • CAMBIA EL NOMBRE DE LOS DELIMITADORES CON ADDRESS_RENAME_DELIMITER_MAP = reemplaza los delimitadores de la cadena de direcciones por una cadena de ADDRESS_RENAME_DELIMITER_MAP

  • RENAME_DIRECTIONS usando ADDRESS_RENAME_DIRECTION_MAP = reemplaza los delimitadores de la cadena de direcciones por una cadena de ADDRESS_RENAME_DIRECTION_MAP

  • RENAME_NUMBERS usando ADDRESS_RENAME_NUMBER_MAP = reemplazar los números de la cadena de direcciones por una cadena de ADDRESS_RENAME_NUMBER_MAP

  • RENAME_SPECIAL_CHARS usando ADDRESS_RENAME_SPECIAL_CHAR_MAP = reemplaza los caracteres especiales de la cadena de direcciones por una cadena de ADDRESS_RENAME_SPECIAL_CHAR_MAP

ADDRESS_RENAME_WORD_MAP

Estas son las palabras a las que se les cambiará el nombre al normalizar la cadena de direcciones.

"avenue": "ave", "bouled": "blvd", "circle": "cir", "circles": "cirs", "court": "ct", "centre": "ctr", "center": "ctr", "drive": "dr", "freeway": "fwy", "frwy": "fwy", "highway": "hwy", "lane": "ln", "parks": "park", "parkways": "pkwy", "pky": "pkwy", "pkway": "pkwy", "pkwys": "pkwy", "parkway": "pkwy", "parkwy": "pkwy", "place": "pl", "plaza": "plz", "plza": "plz", "road": "rd", "square": "sq", "squ": "sq", "sqr": "sq", "street": "st", "str": "st", "str.": "strasse"

ADDRESS_RENAME_DELIMITER_MAP

Estos son los delimitadores a los que se les cambiará el nombre al normalizar la cadena de direcciones.

",": " ", ".": " ", "[": " ", "]": " ", "/": " ", "-": " ", "#": " number "

ADDRESS_RENAME_DIRECTION_MAP

Estos son los identificadores de dirección a los que se cambiará el nombre al normalizar la cadena de direcciones.

"east": "e", "north": "n", "south": "s", "west": "w", "northeast": "ne", "northwest": "nw", "southeast": "se", "southwest": "sw"

ADDRESS_RENAME_NUMBER_MAP

Estas son las cadenas numéricas a las que se les cambiará el nombre al normalizar la cadena de direcciones.

"número": "number", "numero": "number", "no": "number", "núm": "number", "num": "number"

ADDRESS_RENAME_SPECIAL_CHAR_MAP

Estas son las cadenas de caracteres especiales a las que se cambiará el nombre cuando se normalice la cadena de direcciones.

"ß": "ss", "ä": "ae", "ö": "oe", "ü": "ue", "ø": "o", "æ": "ae"

Hashed

  • TRIM = Recorta los espacios en blanco iniciales y finales

Source_ID

  • TRIM = Recorta los espacios en blanco iniciales y finales

Normalización ()ApplyNormalization: solo ML-based

Elija si desea normalizar los datos de entrada tal como se definen en el esquema. La normalización estandariza los datos eliminando los espacios adicionales y los caracteres especiales y estandarizando el formato en minúsculas.

Por ejemplo, si un campo de entrada tiene un tipo de atributo de y los valores de NAME la tabla de entrada tienen el mismo formatoJohns Smith, los valores se AWS Entity Resolution normalizarán a. john smith

En las siguientes secciones se describen las reglas de normalización para los flujos de trabajo coincidentes basados en el aprendizaje automático.

Name

  • TRIM = Recorta los espacios en blanco iniciales y finales

  • LOWERCASE = Pondrá en minúscula todos los caracteres alfabéticos

Correo electrónico

  • MINÚSCULAS = Pondrá en minúscula todos los caracteres alfabéticos

  • Sustituye únicamente (at) (distingue mayúsculas y minúsculas) por un símbolo @

  • Elimina todos los espacios en blanco de cualquier parte del valor

  • Elimina todo lo que esté fuera del primero, "< >" si es que existe

Teléfono

  • TRIM = Recorta los espacios en blanco iniciales y finales

  • REMOVE_ALL_NON_NUMERIC = Elimina todos los caracteres no numéricos [0-9]

  • REMOVE_ALL_LEADING_ZEROES = Elimina todos los ceros iniciales

  • ENSURE_PREFIX_WITH_MAP, «phone» = Examina cada número de teléfono e intenta compararlo con los patrones del teléfono. PrefixMap PrefixMap Si se encuentra una coincidencia, la regla agregará o modificará el prefijo del número de teléfono para garantizar que se ajusta al formato estandarizado especificado en el mapa.

One-to-One coincidente

One-to-one la coincidencia compara instancias individuales de datos similares. Los campos de entrada con la misma clave de coincidencia y los valores del mismo campo de entrada se compararán entre sí.

Por ejemplo, es posible que tenga varios campos de entrada de números de teléfono como «Teléfono» mobile_phone y home_phone que tengan la misma clave coincidente. Usa la coincidencia uno a uno para comparar los datos del campo mobile_phone de entrada con los del campo de mobile_phone entrada y para comparar los datos del campo de home_phone entrada con los del campo de home_phone entrada. Los datos del campo mobile_phone de entrada no se compararán con los datos del campo de home_phone entrada.

Las reglas de coincidencia evalúan los datos de varios campos de entrada con la misma clave de coincidencia en una operación (o), y las coincidencias de uno a varios comparan los valores de un solo campo de entrada. Esto significa que si dos registros home_phone coinciden mobile_phone o coinciden, la clave de coincidencia «Teléfono» devolverá una coincidencia. Para encontrar una coincidencia con la tecla «Teléfono», Record One mobile_phone = Record Two mobile_phone oRecord One home_phone = Record Two home_phone.

Las reglas de coincidencia evalúan los datos de los campos de entrada con diferentes claves de coincidencia mediante una operación (y). Si quieres que las coincidencias basadas en reglas consideren los distintos tipos de información de números de teléfono de forma completamente separada, puedes crear claves de coincidencia más específicas, como «mobile_phone» y «home_phone». Si quieres usar ambas claves de coincidencia en una regla para encontrar coincidencias, Y. Record One mobile_phone = Record Two mobile_phone Record One home_phone = Record Two home_phone

Output

Una lista de OutputAttribute objetos, cada uno de los cuales tiene los campos Nombre y Hash. Cada uno de estos objetos representa una columna que se va a incluir en la tabla AWS Glue de resultados y indica si desea que los valores de la columna estén codificados mediante un hash.

Outputs3Path

El destino S3 en el que se AWS Entity Resolution escribirá la tabla de salida.

OutputSourceConfig

Una lista de OutputSource objetos, cada uno de los cuales tiene los campos Outputs3Path y Output. ApplyNormalization

Comparación basada en el servicio del proveedor

La comparación basada en los servicios de los proveedores es un proceso diseñado para comparar, vincular y mejorar sus registros con los proveedores de servicios de datos preferidos y los conjuntos de datos autorizados. Debe tener una suscripción a través AWS Data Exchange del servicio del proveedor para utilizar esta técnica de comparación.

AWS Entity Resolution actualmente se integra con los siguientes proveedores de servicios de datos:

  • LiveRamp

  • TransUnion

  • UID 2.0

Rule-based coincidente

Rule-based la coincidencia es un proceso diseñado para encontrar coincidencias exactas. Rule-based la coincidencia es un conjunto jerárquico de reglas de coincidencia en cascada, sugeridas por AWS Entity Resolution, basadas en los datos que usted ingresa y que usted puede configurar completamente. Todas las claves de coincidencia proporcionadas dentro de los criterios de la regla deben coincidir exactamente para que los datos comparados se declaren como coincidentes y para que se generen los metadatos asociados. Rule-based La coincidencia devuelve un identificador de coincidencia y un número de regla para cada conjunto de datos coincidente.

Recomendamos definir reglas que puedan identificar de forma exclusiva a una entidad. Ordena primero tus reglas para encontrar coincidencias más precisas.

Por ejemplo, supongamos que tienes dos reglas, la regla 1 y la regla 2.

Estas reglas tienen las siguientes claves de coincidencia:

  • La regla 1 incluye el nombre completo y la dirección

  • La regla 2 incluye el nombre completo, la dirección y el teléfono

Como la Regla 1 se ejecuta primero, la Regla 2 no encontrará ninguna coincidencia porque la Regla 1 habría encontrado todas.

Para buscar coincidencias diferenciadas por número de teléfono, reordene las reglas de la siguiente manera:

  • La regla 2 incluye el nombre completo, la dirección y el teléfono

  • La regla 1 incluye el nombre completo y la dirección

Coincidencia transitiva

La coincidencia transitiva es una función opcional para los flujos de trabajo de coincidencia basados en reglas que utilizan el tipo de regla avanzada. De forma predeterminada, AWS Entity Resolution utiliza un enfoque de coincidencia en cascada en el que los registros que coinciden en un nivel de regla superior se excluyen de las reglas posteriores. Con la coincidencia transitiva habilitada, todos los registros se procesan en todos los niveles de reglas. El identificador de coincidencia de un registro se fija en la primera coincidencia, pero el registro sigue actuando como un enlace para conectar los registros no coincidentes de reglas posteriores con los grupos de reglas anteriores.

Para obtener más información, consulte Uso de la coincidencia transitiva.

Esquema

Término que se utiliza para una estructura o un diseño que define cómo se organiza y conecta un conjunto de datos.

Descripción del esquema

Una descripción opcional del esquema que puede elegir introducir. Las descripciones le ayudan a diferenciar entre las asignaciones de esquemas si crea más de una.

Nombre del esquema

El nombre del esquema.

nota

Los nombres de los esquemas deben ser únicos. No pueden tener el mismo nombre o se generará un error.

Asignación de esquemas

La asignación de esquemas AWS Entity Resolution es el proceso mediante el cual se indica AWS Entity Resolution cómo interpretar los datos para que coincidan. Usted define el esquema de la tabla de datos de entrada que AWS Entity Resolution desea leer en un flujo de trabajo coincidente.

ARN de mapeo de esquemas

El nombre de recurso de Amazon (ARN) generado para la asignación de esquemas.

ID único

Un identificador único que usted designa y que debe asignarse a cada fila de datos de entrada que se AWS Entity Resolution lea.

ejemplo

Por ejemplo: Primary_key, Row_ID o Record_ID.

La columna de identificación única es obligatoria.

El identificador único debe ser un identificador único dentro de una sola tabla.

El identificador único debe cumplir este patrón: [a-zA-Z0-9_-]

En diferentes tablas, el identificador único puede tener valores duplicados.

La longitud máxima del identificador único es de 38 para un flujo de trabajo coincidente

La longitud máxima del identificador único es de 257 caracteres para un Flujo de trabajo de asignación de ID

Cuando se ejecute el flujo de trabajo coincidente, el registro se rechazará si el identificador único:

  • no está especificado

  • no es único en la misma tabla

  • se superpone en términos de nombre de atributo en todas las fuentes

  • supera los 38 caracteres (solo flujos de trabajo coincidentes basados en reglas)