View a markdown version of this page

Creación de un flujo de trabajo coincidente basado en reglas con el tipo de regla simple - AWS Entity Resolution

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Creación de un flujo de trabajo coincidente basado en reglas con el tipo de regla simple

Requisitos previos

Antes de crear un flujo de trabajo coincidente basado en reglas, debes:

  1. Cree una asignación de esquemas. Para obtener más información, consulte Crear un esquema de mapeo.

  2. Si utiliza los perfiles de clientes de Connect como destino de salida, asegúrese de tener configurados los permisos adecuados.

El siguiente procedimiento muestra cómo crear un flujo de trabajo coincidente basado en reglas con el tipo de regla simple mediante la AWS Entity Resolution consola o la CreateMatchingWorkflow API.

Console
Para crear un flujo de trabajo coincidente basado en reglas con Sencillez tipo de regla mediante la consola
  1. Inicie sesión en Consola de administración de AWS y abra la AWS Entity Resolution consola en https://console.aws.amazon.com/entityresolution/.

  2. En el panel de navegación izquierdo, en Flujos de trabajo, seleccione Coincidencia.

  3. En la página Flujos de trabajo coincidentes, en la esquina superior derecha, elige Crear flujo de trabajo coincidente.

  4. Para el paso 1: especificar los detalles del flujo de trabajo coincidente, haga lo siguiente:

    1. Introduzca un nombre de flujo de trabajo coincidente y una descripción opcional.

    2. Para la entrada de datos, elija una AWS Glue base de datos Región de AWS, la AWS Glue tabla y, a continuación, la asignación de esquemas correspondiente.

      Puede agregar hasta 19 entradas de datos.

    3. La opción Normalizar datos está seleccionada de forma predeterminada, de modo que las entradas de datos se normalizan antes de hacer coincidir. Si no desea normalizar los datos, anule la selección de la opción Normalizar datos.

      nota

      La normalización solo se admite en los siguientes escenarios en Crear mapeo de esquemas:

      • Si se agrupan los siguientes subtipos de nombre: nombre, segundo nombre y apellido.

      • Si se agrupan los siguientes subtipos de direcciones: dirección 1 , dirección 2, dirección 3, ciudad, estado, país , código postal.

      • Si se agrupan los siguientes subtipos de teléfono: número de teléfono, código de país del teléfono.

    4. Para especificar los permisos de acceso al servicio, elija una opción y realice la acción recomendada.

      Opción Acción recomendada
      Crear y usar un nuevo rol de servicio
      • AWS Entity Resolution crea un rol de servicio con la política requerida para esta tabla.

      • El Nombre del rol de servicio predeterminado es entityresolution-matching-workflow-<timestamp>.

      • Debe tener permisos para crear roles y adjuntar políticas.

      • Si los datos de entrada están cifrados, puede elegir la opción Estos datos se cifran con una clave de KMS y, a continuación, introducir una AWS KMS clave que se utilizará para descifrar los datos introducidos.

      Usar un rol de servicio existente
      1. Seleccione un Nombre de rol de servicio existente en la lista desplegable.

        Si tiene permisos de listas de roles, se mostrará la lista de roles.

        Si no tiene permisos de listas de roles, puede ingresar el nombre de recurso de Amazon (ARN) del rol que desea usar.

        Si no hay ningún rol de servicio existente, la opción Usar un rol de servicio existente no estará disponible.

      2. Consulte el rol de servicio mediante la elección del enlace externo Ver en IAM.

        De forma predeterminada, AWS Entity Resolution no intenta actualizar la política de roles existente para agregar los permisos necesarios.

    5. (Opcional) Para habilitar las etiquetas del recurso, elija Agregar nueva etiqueta y, a continuación, introduzca el par clave y valor.

    6. Elija Siguiente.

  5. Para el paso 2: elige la técnica de coincidencia:

    1. Para el método de coincidencia, elige el método de Rule-based coincidencia.

    2. En Tipo de regla, elija Simple.

      Seleccione la pantalla de técnica de coincidencia con la opción de combinación simple basada en reglas seleccionadas.
    3. En Cadencia de procesamiento, seleccione una de las siguientes opciones.

      • Seleccione Manual para ejecutar un flujo de trabajo bajo demanda para una actualización masiva

      • Seleccione Automático para ejecutar un flujo de trabajo tan pronto como haya nuevos datos en su bucket de S3

      nota

      Si eliges Automático, asegúrate de tener activadas EventBridge las notificaciones de Amazon para tu bucket de S3. Para obtener instrucciones sobre cómo habilitar Amazon EventBridge con la consola S3, consulte Habilitar Amazon EventBridge en la guía del usuario de Amazon S3.

    4. (Opcional) En el caso de indexar solo para la asignación de ID, puede optar por activar la posibilidad de indexar únicamente los datos y no generar ID.

      De forma predeterminada, los flujos de trabajo coincidentes generan ID después de indexar los datos.

    5. En el caso de las reglas coincidentes, introduzca un nombre de regla y, a continuación, elija las claves de coincidencia para esa regla.

      Puedes crear hasta 15 reglas y aplicar hasta 15 claves de coincidencia diferentes en todas tus reglas para definir los criterios de coincidencia.

      Interfaz de reglas de coincidencia con campos para introducir el nombre de la regla y seleccionar las claves de coincidencia.
    6. Para el tipo de comparación, elige una de las siguientes opciones en función de tu objetivo.

      Su objetivo Opción recomendada
      Busca cualquier combinación de coincidencias entre los datos almacenados en varios campos de entrada Múltiples campos de entrada
      Limite la comparación a un solo campo de entrada Campo de entrada único
      Opciones de tipo de comparación: varios campos de entrada para encontrar coincidencias entre los datos almacenados en varios campos, o un campo de entrada único para limitar la comparación dentro de un campo.
    7. Elija Siguiente.

  6. Para el paso 3: especifique la salida y el formato de los datos:

    1. Para el destino y el formato de la salida de datos, elija la ubicación de Amazon S3 para la salida de datos y si el formato de datos será de datos normalizados o de datos originales.

    2. Para el cifrado, si elige personalizar la configuración de cifrado, introduzca la AWS KMS clave ARN.

    3. Vea el resultado generado por el sistema.

    4. En el caso de la salida de datos, decida qué campos quiere incluir, ocultar o enmascarar y, a continuación, tome las medidas recomendadas en función de sus objetivos.

      Su objetivo Acción recomendada
      Incluye campos Mantenga el estado de salida como Incluido.
      Ocultar campos (excluir de la salida) Seleccione el campo Salida y, a continuación, elija Ocultar.
      Enmascarar campos Elija el campo Salida y, a continuación, elija Salida hash.
      Restablece la configuración anterior Elija Restablecer.
    5. Elija Siguiente.

  7. Para el paso 4: Revisa y crea:

    1. Revise las selecciones que realizó en los pasos anteriores y edítelas si es necesario.

    2. Elija Create and run.

      Aparece un mensaje que indica que se ha creado el flujo de trabajo correspondiente y que el trabajo se ha iniciado.

  8. En la página de detalles del flujo de trabajo correspondiente, en la pestaña Métricas, consulta lo siguiente en Métricas del último trabajo:

    • El identificador del trabajo.

    • El estado del trabajo de flujo de trabajo correspondiente: En cola, En curso, Completado , Fallido

    • El tiempo de finalización del trabajo de flujo de trabajo.

    • El número de registros procesados.

    • El número de registros no procesados.

    • Los identificadores de coincidencia únicos generados.

    • El número de registros de entrada.

    También puedes ver las métricas de los trabajos para ver si coinciden con los trabajos del flujo de trabajo que se han ejecutado anteriormente en el historial de trabajos.

  9. Cuando se complete el trabajo del flujo de trabajo correspondiente (el estado es Completado), puede ir a la pestaña de salida de datos y, a continuación, seleccionar su ubicación de Amazon S3 para ver los resultados.

  10. (Solo para el tipo de procesamiento manual) Si ha creado un flujo de trabajo Rule-based coincidente con el tipo de procesamiento manual, puede ejecutar el flujo de trabajo correspondiente en cualquier momento seleccionando Ejecutar flujo de trabajo en la página de detalles del flujo de trabajo correspondiente.

API
Para crear un flujo de trabajo coincidente basado en reglas con el Sencillez tipo de regla mediante la API
nota

De forma predeterminada, el flujo de trabajo utiliza el procesamiento estándar (por lotes). Para utilizar el procesamiento incremental (automático), debe configurarlo de forma explícita.

  1. Abre una terminal o una línea de comandos para realizar la solicitud a la API.

  2. Crea una solicitud POST para el siguiente punto final:

    /matchingworkflows
  3. En el encabezado de la solicitud, Content-type defina como application/json.

    nota

    Para obtener una lista completa de los lenguajes de programación compatibles, consulta la referencia de la AWS Entity Resolution API .

  4. Para el cuerpo de la solicitud, proporciona los siguientes parámetros JSON obligatorios:

    { "description": "string", "incrementalRunConfig": { "incrementalRunType": "string" }, "inputSourceConfig": [ { "applyNormalization": boolean, "inputSourceARN": "string", "schemaName": "string" } ], "outputSourceConfig": [ { "applyNormalization": boolean, "KMSArn": "string", "output": [ { "hashed": boolean, "name": "string" } ], "outputS3Path": "string" } ], "resolutionTechniques": { "providerProperties": { "intermediateSourceConfiguration": { "intermediateS3Path": "string" }, "providerConfiguration": JSON value, "providerServiceArn": "string" }, "resolutionType": "RULE_MATCHING", "ruleBasedProperties": { "attributeMatchingModel": "string", "matchPurpose": "string", "rules": [ { "matchingKeys": [ "string" ], "ruleName": "string" } ] }, "ruleConditionProperties": { "rules": [ { "condition": "string", "ruleName": "string" } ] } }, "roleArn": "string", "tags": { "string" : "string" }, "workflowName": "string" }

    Donde:

    • workflowName(obligatorio): debe ser único y debe coincidir con un patrón de entre 1 y 255 caracteres [a-z A-Z _0-9-] *

    • inputSourceConfig(obligatorio): lista de 1 a 20 configuraciones de fuentes de entrada

    • outputSourceConfig(obligatorio): exactamente una configuración de fuente de salida

    • resolutionTechniques(obligatorio): configúrelo en «RULE_MATCHING» para obtener coincidencias basadas en reglas

    • roleArn(obligatorio): ARN del rol de IAM para la ejecución del flujo de trabajo

    • ruleConditionProperties(obligatorio): lista de las condiciones de la regla y el nombre de la regla correspondiente.

    Los parámetros opcionales incluyen:

    • description— Hasta 255 caracteres

    • incrementalRunConfig— Configuración de tipo de ejecución incremental

    • tags— Hasta 200 pares clave-valor

  5. (Opcional) Para utilizar el procesamiento incremental en lugar del procesamiento estándar (por lotes) predeterminado, añada el siguiente parámetro al cuerpo de la solicitud:

    "incrementalRunConfig": { "incrementalRunType": "AUTOMATIC" }
  6. Envíe la solicitud .

  7. Si se realiza correctamente, recibirás una respuesta con el código de estado 200 y un cuerpo JSON que contiene:

    { "workflowArn": "string", "workflowName": "string", // Plus all configured workflow details }
  8. Si la llamada no se realiza correctamente, es posible que recibas uno de los siguientes errores:

    • 400: ConflictException si el nombre del flujo de trabajo ya existe

    • 400: ValidationException si la entrada no se valida

    • 402 — ExceedsLimitException si se superan los límites de la cuenta

    • 403: AccessDeniedException si no tienes suficiente acceso

    • 429 — ThrottlingException si la solicitud fue limitada

    • 500: InternalServerException si hay una falla en el servicio interno