View a markdown version of this page

データソースを同期する - Amazon Bedrock

翻訳は機械翻訳により提供されています。提供された翻訳内容と英語版の間で齟齬、不一致または矛盾がある場合、英語版が優先します。

データソースを同期する

ナレッジベースを作成したら、データを取り込むか同期して、クエリできるようにします。取り込みは、データソースの raw データをベクトル埋め込みに変換します。

取り込みの開始前に、データソースが次の条件を満たしていることを確認してください。

データソースからファイルを追加、変更、または削除するたびに、ナレッジベースでファイルのインデックスが再作成されるように、データソースを同期する必要があります。同期は増分処理であるため、前回の同期以降に追加、変更、または削除されたドキュメントだけが処理されます。

データをナレッジベースに取り込み、最新のデータと同期する方法を確認するには、任意の方法のタブを選択してステップを実行してください。

Console
データをナレッジベースに取り込み、最新のデータと同期するには
  1. にサインイン AWS マネジメントコンソール し、Amazon Bedrock AgentCore > 組み込みツール > ナレッジベースに移動します。

  2. ナレッジベースを選択します。

  3. [データソース] セクションで [同期] を選択して、データの取り込み (データインジェスト) または最新データの同期を開始します。同期中のデータソースを停止するには、[停止] を選択します。停止できるのは、同期中のデータソースだけです。[同期] をもう一度選択すると、残りのデータを取り込むことができます。

  4. データインジェストが正常に完了すると、緑色の成功バナーが表示されます。

  5. データソースを選択して、そのデータソースの [同期履歴] を表示することができます。[警告を表示] を選択すると、データインジェストジョブが失敗した理由を確認できます。

API

ナレッジベースにデータを取り込み、最新のデータと同期するには、Amazon Bedrock エージェントのビルドタイムエンドポイントStartIngestionJob リクエストを送信します。knowledgeBaseIddataSourceId を指定してください。StopIngestionJob リクエストを送信することで、実行中のデータインジェストジョブを停止することもできます。dataSourceIdingestionJobId、および knowledgeBaseId を指定します。停止できるのは、実行中のデータインジェストジョブのみです。準備ができたら、StartIngestionJob リクエストを再送信して、残りのデータを取り込むことができます。

レスポンスで返された ingestionJobId を使用して、Amazon Bedrock エージェントのビルドタイムエンドポイントGetIngestionJob リクエストを送信し、取り込みジョブのステータスを追跡します。また、knowledgeBaseIddataSourceId も指定します。

  • 取り込みジョブが完了すると、レスポンス内の statusCOMPLETE になります。

  • レスポンス内の statistics オブジェクトは、データソース内のドキュメントの取り込みが成功したかどうかに関する情報を返します。

また、Amazon Bedrock エージェントのビルドタイムエンドポイントListIngestionJobs リクエストを送信することで、データソースのすべての取り込みジョブに関する情報を確認することもできます。dataSourceId と、データの取り込み先のナレッジベースの knowledgeBaseId を指定してください。

  • 検索するステータスを filters オブジェクトで指定して、結果をフィルタリングします。

  • sortBy オブジェクトを指定して、ジョブの開始時間またはジョブのステータスでソートします。昇順または降順で並べ替えることができます。

  • レスポンスで返す結果の最大数を maxResults フィールドで設定します。設定した数よりも結果の件数が多い場合は、nextToken が返されます。これを別の ListIngestionJobs リクエストで送信して、ジョブの次のバッチを確認できます。

データソースの同期スケジュールを設定する

コンテンツが変更されるたびに手動で同期を開始する代わりに、Amazon Bedrock が定期的にデータソースを自動的に同期するように同期スケジュールを設定できます。スケジュールされた同期は、手動アクションなしでナレッジベースを最新の状態に保つのに役立ちます。データソースを接続するときに同期スケジュールを設定し、後でデータソースを編集して変更できます。

次のいずれかの頻度を選択できます。

[オンデマンド]

コンテンツは、手動で同期を開始した場合にのみ同期されます。自動スケジューリングは行われません。これはデフォルトの頻度です。

1 日 1 回

コンテンツは、自動的にスケジュールされた時刻に 1 日 1 回同期されます。これは異なる場合があります。

Weekly

コンテンツは、指定した曜日の週 1 回、自動的にスケジュールされた時刻に同期されます。

月別

コンテンツは、指定した日の毎月 1 回、自動的にスケジュールされた時刻に同期されます。1~28 の特定の日を選択するか、月末を選択します。

データソースの同期スケジュールを設定するには、任意の方法のタブを選択し、ステップに従います。

Console

データソースを接続するとき、または既存のデータソースを編集するときは、同期スケジュールセクションを見つけて頻度を選択します。

  • Weekly を選択した場合は、同期が実行される曜日を選択します。

  • Monthly を選択する場合は、特定の日 (1~28) を選択するか、月末を選択します。

データソースの接続の詳細については、「データソースの接続」を参照してください。

API

API、 AWS SDK、または で同期スケジュールを設定するには AWS CLI、Amazon Bedrock エージェントのビルドタイムエンドポイントを使用して CreateDataSource または UpdateDataSource リクエストを送信するときにmanagedKnowledgeBaseConnectorConfiguration、 ( 内dataSourceConfiguration) に syncSchedule オブジェクトを含めます。 https://docs.aws.amazon.com/general/latest/gr/bedrock.html#bra-btオンデマンド同期を使用するには、 を省略しますsyncSchedule

syncSchedule、次の頻度フィールドのいずれかを正確に指定します。

  • daily – 空のオブジェクト ({})。コンテンツは、システムが選択したオフピーク時に 1 日に 1 回同期されます。

  • weeklydayOfWeek必須フィールドを持つオブジェクト。有効な値は、SUNDAYMONDAYTUESDAYWEDNESDAYTHURSDAYFRIDAYSATURDAY です。

  • monthlydayOfMonth必須フィールドを持つオブジェクト。でdayOfMonth、次のいずれかを正確に指定します。

    • dayNumber – から 1までの特定の日28

    • lastDayOfMonth – 毎月最終暦日に同期を実行する空のオブジェクト ({})。

次の例は、月曜日に毎週同期をスケジュールdataSourceConfigurationする を示しています。

"dataSourceConfiguration": { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "connectorParameters": { "type": "CONNECTOR_TYPE", "version": "1" }, "syncSchedule": { "weekly": { "dayOfWeek": "MONDAY" } } } }

毎月 15 日に同期するには、syncSchedule値を以下に置き換えます。

"syncSchedule": { "monthly": { "dayOfMonth": { "dayNumber": 15 } } }

スケジュールを設定すると、Amazon Bedrock は選択した頻度で自動的に同期を実行します。手動同期はいつでも開始できます。スケジュールされた同期ジョブと手動同期ジョブを追跡するには、データソースの詳細ページで同期履歴を表示します。詳細については、「Amazon Bedrock ナレッジベースのデータソース情報を表示する」を参照してください。