View a markdown version of this page

Sincronizar uma fonte de dados - Amazon Bedrock

As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.

Sincronizar uma fonte de dados

Depois de criar a base de conhecimento, ingira ou sincronize os dados para que eles possam ser consultados. A ingestão converte os dados brutos em sua fonte de dados em incorporações vetoriais.

Antes de começar a ingestão, verifique se a fonte de dados atende às seguintes condições:

  • Você configurou as informações de conexão da fonte de dados. Consulte Conectar uma fonte de dados. Você configura a fonte de dados como parte criação da base de conhecimento.

  • Você configurou o modelo de incorporação vetorial escolhido. Veja os modelos de incorporação vetorial suportados. Você configura as incorporações de vetores como parte da criação da base de conhecimento.

  • Os arquivos estão nos formatos compatíveis. Para obter mais informações, consulte Formatos de documentos compatíveis.

  • Os arquivos não excedem o tamanho do arquivo do trabalho de ingestão especificado em Cotas e cotas de serviço na AWS Referência geral.

Sempre que você adicionar, modificar ou remover arquivos da fonte de dados, sincronize a fonte de dados para que ela seja reindexada na base de conhecimento. A sincronização é incremental, portanto, o Amazon Bedrock processa somente documentos adicionados, modificados ou excluídos desde a última sincronização.

Para saber como ingerir dados na base de conhecimento e sincronizar com os dados mais recentes, escolha a guia correspondente ao método de sua preferência e siga as etapas:

Console
Saiba como ingerir dados na base de conhecimento e sincronizar com os dados mais recentes.
  1. Faça login no Console de gerenciamento da AWS e navegue até Amazon Bedrock AgentCore > Built-in ferramentas > Base de conhecimento.

  2. Escolha sua base de conhecimento.

  3. Na seção Fonte de dados, selecione Sincronizar para iniciar a ingestão de dados ou a sincronização dos dados mais recentes. Para interromper a sincronização de uma fonte de dados em andamento, selecione Parar. Uma fonte de dados deve estar em sincronização para que a sincronização da fonte de dados seja interrompida. É possível selecionar Sincronizar novamente para ingerir o resto dos dados.

  4. Quando a ingestão de dados for concluída, um banner verde de sucesso será exibido se ela tiver sido bem-sucedida.

  5. Você pode escolher uma fonte de dados para ver o Histórico de sincronização. Selecione Visualizar avisos para ver por que um trabalho de ingestão de dados falhou.

API

Para ingerir seus dados em sua base de conhecimento e sincronizar com seus dados mais recentes, envie uma StartIngestionJob solicitação com um endpoint de tempo de construção do Agents for Amazon Bedrock. Especifique o knowledgeBaseId e o dataSourceId. Você também pode interromper um trabalho de ingestão de dados atualmente em execução enviando uma StopIngestionJob solicitação. Especifique o dataSourceId, o ingestionJobId e o knowledgeBaseId. Um trabalho de ingestão de dados deve estar em execução para interromper a ingestão de dados. É possível enviar uma solicitação StartIngestionJob novamente para ingerir o resto dos seus dados quando tudo estiver pronto.

Use o ingestionJobId retornado na resposta em uma GetIngestionJob solicitação com um endpoint de tempo de construção do Agents for Amazon Bedrock para rastrear o status do trabalho de ingestão. Além disso, especifique o knowledgeBaseId e o dataSourceId.

  • Quando o trabalho de ingestão for concluído, o status na resposta será COMPLETE.

  • O objeto statistics na resposta retorna informações sobre se a ingestão foi bem-sucedida ou não para documentos na fonte de dados.

Você também pode ver as informações de todos os trabalhos de ingestão de uma fonte de dados enviando uma ListIngestionJobs solicitação com um endpoint de tempo de construção do Agents for Amazon Bedrock. Especifique o dataSourceId e o knowledgeBaseId da base de conhecimento na qual os dados estão sendo ingeridos.

  • Filtre os resultados especificando um status a ser pesquisado no objeto filters.

  • Classifique pela hora em que o trabalho foi iniciado ou pelo status de um trabalho, especificando o objeto sortBy. É possível classificar em ordem crescente ou decrescente.

  • Defina o número máximo de resultados a serem retornados em uma resposta no campo maxResults. Se houver mais resultados do que o número definido, a resposta retornará um nextToken que você poderá enviar em outra solicitação ListIngestionJobs para ver o próximo lote de trabalhos.

Definir um cronograma de sincronização para uma fonte de dados

Em vez de iniciar manualmente uma sincronização toda vez que seu conteúdo for alterado, você pode definir um cronograma de sincronização para que o Amazon Bedrock sincronize automaticamente uma fonte de dados em uma frequência recorrente. As sincronizações agendadas ajudam a manter sua base de conhecimento atualizada sem ação manual. Você define o cronograma de sincronização ao conectar uma fonte de dados e pode alterá-lo posteriormente editando a fonte de dados.

Você pode escolher uma das seguintes frequências:

On-demand

O conteúdo é sincronizado somente quando você inicia uma sincronização manualmente. Nenhum agendamento automático ocorre. Essa é a frequência padrão.

Por dia

O conteúdo é sincronizado uma vez por dia em um horário agendado automaticamente, o que pode variar.

Weekly

O conteúdo é sincronizado uma vez por semana, em um dia da semana que você especificar, em um horário agendado automaticamente.

Mensal

O conteúdo é sincronizado uma vez por mês, em um dia do mês que você especificar, em um horário agendado automaticamente. Escolha um dia específico de 1 a 28 ou escolha o final do mês.

Para definir um cronograma de sincronização para uma fonte de dados, escolha a guia do seu método preferido e siga as etapas:

Console

Ao conectar uma fonte de dados ou editar uma fonte de dados existente, encontre a seção Programação de sincronização e escolha uma Frequência:

  • Se você escolher Semanalmente, selecione o dia da semana em que a sincronização é executada.

  • Se você escolher Mensalmente, selecione um dia específico do mês (1—28) ou selecione o final do mês.

Para obter mais informações sobre como conectar uma fonte de dados, consulte Conectar uma fonte de dados.

API

Para definir um cronograma de sincronização com a API, um AWS SDK ou o AWS CLI, inclua um syncSchedule objeto no managedKnowledgeBaseConnectorConfiguration (dentrodataSourceConfiguration) ao enviar uma UpdateDataSource solicitação CreateDataSource ou a um endpoint de tempo de construção do Agents for Amazon Bedrock. Para usar a sincronização sob demanda, omita. syncSchedule

EmsyncSchedule, especifique exatamente um dos seguintes campos de frequência:

  • daily— Um objeto vazio ({}). O conteúdo é sincronizado uma vez por dia em um horário fora do horário de pico escolhido pelo sistema.

  • weekly— Um objeto com um dayOfWeek campo obrigatório. Os valores válidos são SUNDAY, MONDAY, TUESDAY, WEDNESDAY, THURSDAY, FRIDAY e SATURDAY.

  • monthly— Um objeto com um dayOfMonth campo obrigatório. EmdayOfMonth, especifique exatamente uma das seguintes opções:

    • dayNumber— Um dia específico do mês, 1 de 28 a.

    • lastDayOfMonth— Um objeto vazio ({}) que executa a sincronização no último dia do calendário de cada mês.

O exemplo a seguir mostra uma dataSourceConfiguration que agenda uma sincronização semanal às segundas-feiras:

"dataSourceConfiguration": { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "connectorParameters": { "type": "CONNECTOR_TYPE", "version": "1" }, "syncSchedule": { "weekly": { "dayOfWeek": "MONDAY" } } } }

Para sincronizar no dia 15 de cada mês, substitua o syncSchedule valor pelo seguinte:

"syncSchedule": { "monthly": { "dayOfMonth": { "dayNumber": 15 } } }

Depois de definir um cronograma, o Amazon Bedrock executa sincronizações automaticamente na frequência que você escolher. Você ainda pode iniciar uma sincronização manual a qualquer momento. Para rastrear trabalhos de sincronização programados e manuais, veja o histórico de sincronização na página de detalhes da fonte de dados. Para obter mais informações, consulte Exibir informações da fonte de dados para sua base de conhecimento do Amazon Bedrock.