View a markdown version of this page

Sincronización de un origen de datos - Amazon Bedrock

Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.

Sincronización de un origen de datos

Tras crear la base de conocimientos, puede ingerir o sincronizar los datos para poder consultarlos. La ingestión convierte los datos sin procesar de su fuente de datos en incrustaciones vectoriales.

Antes de iniciar la ingesta, compruebe que el origen de datos cumpla las siguientes condiciones:

  • Se ha configurado la información de conexión del origen de datos. Consulte Conectar una fuente de datos. Se ha configurado el origen de datos como parte de los pasos de creación de la base de conocimientos.

  • Ha configurado el modelo de incrustaciones vectoriales elegido. Consulte los modelos de incrustaciones vectoriales compatibles. Se han configurado las incrustaciones vectoriales como parte de los pasos de creación de la base de conocimientos.

  • Los archivos son del formato admitido. Para obtener más información, consulte Formatos de documentos compatibles.

  • Los archivos no superan el tamaño del archivo de trabajo de ingestión especificado en las cuotas de servicio y las cuotas de la Referencia AWS general.

Cada vez que añada, modifique o elimine archivos del origen de datos, debe sincronizar el origen de datos para volver a indexarlo en la base de conocimientos. La sincronización es incremental, por lo que Amazon Bedrock solo procesa los documentos añadidos, modificados o eliminados desde la última sincronización.

Para obtener más información sobre cómo ingerir los datos en la base de conocimiento y sincronizarlos con los datos más recientes, seleccione la pestaña correspondiente al método que prefiera y siga estos pasos:

Console
Ingesta de los datos en la base de conocimientos y sincronización con los datos más actuales
  1. Inicie sesión Consola de administración de AWS y vaya a Amazon Bedrock AgentCore > Built-in herramientas > Base de conocimientos.

  2. Elija su base de conocimientos.

  3. En la sección Origen de datos, seleccione Sincronizar para iniciar la ingesta de datos o para sincronizar con los datos más recientes. Para detener la sincronización actual de un origen de datos, seleccione Detener. Un origen de datos debe estar sincronizándose para poder detener la sincronización. Puede seleccionar Sincronizar para ingerir el resto de los datos.

  4. Cuando se complete la ingesta de datos, aparecerá un banner verde de confirmación si se ha realizado correctamente.

  5. Puede elegir un origen de datos para ver su Historial de sincronización. Seleccione Ver advertencias para ver por qué ha fallado un trabajo de ingesta de datos.

API

Para incorporar los datos a la base de conocimientos y sincronizarlos con los datos más recientes, envíe una StartIngestionJob solicitud a un terminal de Agents for Amazon Bedrock en tiempo de construcción. Especifique el knowledgeBaseId y el dataSourceId. También puede detener un trabajo de ingesta de datos que se esté ejecutando actualmente enviando una solicitud. StopIngestionJob Especifique los valores de dataSourceId, ingestionJobId y knowledgeBaseId. Debe haber un trabajo de ingesta de datos en ejecución para detener la ingesta de datos. Puede volver a enviar una solicitud StartIngestionJob para ingerir el resto de los datos cuando esté listo.

Utilice lo que ingestionJobId arroje la respuesta en una GetIngestionJob solicitud con un punto final en tiempo de compilación de Agents for Amazon Bedrock para realizar un seguimiento del estado del trabajo de ingestión. Además, especifique el knowledgeBaseId y el dataSourceId.

  • Cuando finalice el trabajo de ingesta, el status de la respuesta es COMPLETE.

  • El objeto statistics de la respuesta devuelve información sobre si la ingesta se realizó correctamente o no en el caso de los documentos del origen de datos.

También puede consultar la información de todos los trabajos de ingestión de una fuente de datos enviando una ListIngestionJobs solicitud a un punto de enlace en tiempo de compilación de Agents for Amazon Bedrock. Especifique el dataSourceId y el knowledgeBaseId de la base de conocimientos desde los que se ingieren los datos.

  • Filtre los resultados especificando el estado que desee buscar en el objeto filters.

  • Puede ordenarlos por la hora en que se inició el trabajo o por el estado de un trabajo especificando el objeto sortBy. Puede especificar un orden ascendente o descendente.

  • Especifique el número máximo de resultados que se devuelven en una respuesta en el campo maxResults. Si hay más resultados que la cantidad que ha establecido, la respuesta devuelve un nextToken que puede enviar en otra solicitud ListIngestionJobs para ver el siguiente lote de trabajos.

Establezca un cronograma de sincronización para una fuente de datos

En lugar de iniciar manualmente una sincronización cada vez que cambie el contenido, puede establecer un programa de sincronización para que Amazon Bedrock sincronice automáticamente una fuente de datos con una frecuencia recurrente. Las sincronizaciones programadas ayudan a mantener su base de conocimientos actualizada sin necesidad de realizar ninguna acción manual. La programación de sincronización se establece cuando se conecta una fuente de datos y se puede cambiar más adelante editando la fuente de datos.

Puede elegir una de las siguientes frecuencias:

On-demand

El contenido solo se sincroniza cuando inicias una sincronización manualmente. No se produce ninguna programación automática. Esta es la frecuencia predeterminada.

Por día

El contenido se sincroniza una vez al día a una hora programada automáticamente, que puede variar.

Weekly

El contenido se sincroniza una vez a la semana, el día de la semana que especifiques, a una hora programada automáticamente.

Mensual

El contenido se sincroniza una vez al mes, el día del mes que especifiques, a una hora programada automáticamente. Elige un día específico del 1 al 28, o elige el final del mes.

Para establecer una programación de sincronización para una fuente de datos, selecciona la pestaña del método que prefieras y, a continuación, sigue estos pasos:

Console

Al conectar una fuente de datos o al editar una fuente de datos existente, busca la sección Programación de sincronización y elige una frecuencia:

  • Si eliges Semanal, selecciona el día de la semana en el que se ejecuta la sincronización.

  • Si eliges Mensual, selecciona un día específico del mes (del 1 al 28) o selecciona el final del mes.

Para obtener más información sobre cómo conectar una fuente de datos, consulte Conectar una fuente de datos.

API

Para establecer un cronograma de sincronización con la API, un AWS SDK o el AWS CLI, incluye un syncSchedule objeto en managedKnowledgeBaseConnectorConfiguration (dentro dedataSourceConfiguration) cuando envíes un punto de enlace en tiempo de construcción de Agents for Amazon Bedrock CreateDataSource o envíes una UpdateDataSource solicitud a él. Para usar la sincronización bajo demanda, omita. syncSchedule

EnsyncSchedule, especifique exactamente uno de los siguientes campos de frecuencia:

  • daily— Un objeto vacío ({}). El contenido se sincroniza una vez al día a la hora de menor actividad elegida por el sistema.

  • weekly— Un objeto con un campo obligatorio. dayOfWeek Los valores válidos son SUNDAY, MONDAY, TUESDAY, WEDNESDAY, THURSDAY, FRIDAY y SATURDAY.

  • monthly— Un objeto con un dayOfMonth campo obligatorio. EndayOfMonth, especifique exactamente una de las siguientes opciones:

    • dayNumber— Un día específico del mes, desde 1 hasta28.

    • lastDayOfMonth— Un objeto vacío ({}) que ejecuta la sincronización el último día natural de cada mes.

El siguiente ejemplo muestra dataSourceConfiguration que programa una sincronización semanal los lunes:

"dataSourceConfiguration": { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "connectorParameters": { "type": "CONNECTOR_TYPE", "version": "1" }, "syncSchedule": { "weekly": { "dayOfWeek": "MONDAY" } } } }

Para sincronizar el día 15 de cada mes, reemplaza el syncSchedule valor por el siguiente:

"syncSchedule": { "monthly": { "dayOfMonth": { "dayNumber": 15 } } }

Tras establecer un cronograma, Amazon Bedrock ejecuta las sincronizaciones automáticamente con la frecuencia que usted elija. Aún puede iniciar una sincronización manual en cualquier momento. Para realizar un seguimiento de los trabajos de sincronización programados y manuales, consulta el historial de sincronización en la página de detalles de la fuente de datos. Para obtener más información, consulte Ver la información de la fuente de datos de su base de conocimientos de Amazon Bedrock.