View a markdown version of this page

Hinzufügen von Datenquellen und Starten der Aufnahme - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Hinzufügen von Datenquellen und Starten der Aufnahme

Nachdem Sie Ihre Wissensdatenbank erstellt haben, fügen Sie Datenquellen hinzu, die Ihre multimodalen Inhalte enthalten, und starten Sie Aufnahmeaufträge, um den Inhalt zu verarbeiten und zu indizieren.

Verhalten beim Löschen von Datenquellen

Wenn Sie eine Datenquelle löschen, bei der die Löschrichtlinie auf RETAIN gesetzt ist, verbleibt der aufgenommene Inhalt in der Vektordatenbank und wird weiterhin zum Abrufen verwendet. Der Inhalt wird nur entfernt, wenn Sie die Wissensdatenbank nach dem Löschen der Datenquelle explizit synchronisieren. Datenquellen mit der standardmäßigen DELETE-Richtlinie entfernen beim Löschen automatisch Inhalte aus der Vektordatenbank und aus dem zusätzlichen Speicher. Dadurch wird sichergestellt, dass Ihre Wissensdatenbank auch dann weiterhin funktioniert, wenn Quelldateien geändert oder gelöscht werden. Gelöschte Datenquellen mit der RETAIN-Richtlinie können jedoch weiterhin zu den Suchergebnissen beitragen.

Fügen Sie Datenquellen hinzu

Fügen Sie Ihrer Wissensdatenbank Datenquellen hinzu, die Ihre multimodalen Inhalte enthalten.

Wichtig

Für BDA-Datenquellen: Nur Datenquellen, die nach dem Start des audio/video Supports erstellt wurden, verarbeiten Audio- und Videodateien. Bestehende BDA-Datenquellen, die vor dem Start dieser Funktion erstellt wurden, überspringen weiterhin Audio- und Videodateien. Um die audio/video Verarbeitung vorhandener Wissensdatenbanken zu ermöglichen, erstellen Sie neue Datenquellen.

Console
Um eine Datenquelle von der Konsole aus hinzuzufügen
  1. Wählen Sie auf der Detailseite Ihrer Wissensdatenbank die Option Datenquelle hinzufügen aus.

  2. Wählen Sie Amazon S3 als Datenquellentyp.

  3. Geben Sie einen Namen und eine Beschreibung für Ihre Datenquelle ein.

  4. Konfigurieren Sie den Amazon S3-Speicherort, der Ihre multimodalen Dateien enthält, indem Sie den Bucket-URI und alle Inklusionspräfixe angeben.

  5. Konfigurieren Sie unter Inhaltsanalyse und Chunking Ihre Parsing- und Chunking-Methoden:

    Anmerkung

    Modelle zur Texteinbettung beschränken den Abruf auf reine Textinhalte. Sie können jedoch den multimodalen Abruf über Text aktivieren, indem Sie entweder Amazon Bedrock Data Automation (für Audio, Video und Bilder) oder Foundation Model als Parser (für Bilder) auswählen.

    Wählen Sie aus drei Parsing-Strategien:

    • Bedrock-Standardparser: Empfohlen für das reine Textparsen. Dieser Parser ignoriert multimodale Inhalte und wird häufig mit multimodalen Einbettungsmodellen verwendet.

    • Bedrock Data Automation als Parser: Ermöglicht das Parsen und Speichern multimodaler Inhalte als Text und unterstützt PDFs, Bilder, Audio- und Videodateien.

    • Foundation-Modell als Parser: Bietet erweitertes Parsen für Bilder und strukturierte Dokumente und unterstützt PDFs, Bilder, Tabellen und visuell ansprechende Dokumente.

  6. Wählen Sie Datenquelle hinzufügen, um die Datenquelle zu erstellen.

CLI
Um eine Datenquelle hinzuzufügen, verwenden Sie AWS CLI
  • Erstellen Sie eine Datenquelle für Ihre multimodalen Inhalte. Senden Sie eine CreateDataSource Anfrage:

    aws bedrock-agent create-data-source \ --knowledge-base-id <knowledge-base-id> \ --cli-input-json file://ds-multimodal.json

    Verwenden Sie für Nova Multimodal Embeddings (keine spezielle Parsing-Konfiguration erforderlich) diesen Inhalt: ds-multimodal.json

    { "dataSourceConfiguration": { "type": "S3", "s3Configuration": { "bucketArn": "arn:aws:s3:::<data-source-bucket>", "inclusionPrefixes": ["<folder-path>"] } }, "name": "multimodal_data_source", "description": "Data source with multimodal content", "dataDeletionPolicy": "RETAIN" }

    Verwenden Sie für den BDA-Parsing-Ansatz diese Konfiguration:

    { "dataSourceConfiguration": { "type": "S3", "s3Configuration": { "bucketArn": "arn:aws:s3:::<data-source-bucket>", "inclusionPrefixes": ["<folder-path>"] } }, "name": "multimodal_data_source_bda", "description": "Data source with BDA multimodal parsing", "dataDeletionPolicy": "RETAIN", "vectorIngestionConfiguration": { "parsingConfiguration": { "bedrockDataAutomationConfiguration": { "parsingModality": "MULTIMODAL" } } } }

Starten Sie einen Aufnahmeauftrag

Nachdem Sie Ihre Datenquellen hinzugefügt haben, starten Sie einen Aufnahmejob, um Ihre multimodalen Inhalte zu verarbeiten und zu indizieren.

Console
Um die Erfassung von der Konsole aus zu starten
  1. Wählen Sie auf der Seite mit den Datenquellendetails die Option Synchronisieren aus.

  2. Überwachen Sie den Synchronisierungsstatus auf der Datenquellenseite. Die Aufnahme kann je nach Größe und Anzahl Ihrer multimodalen Dateien mehrere Minuten dauern.

  3. Sobald die Synchronisierung erfolgreich abgeschlossen ist, können Ihre multimodalen Inhalte abgefragt werden.

CLI
Um die Aufnahme zu starten, verwenden Sie das AWS CLI
  1. Starten Sie einen Aufnahmevorgang. Senden Sie eine Anfrage StartIngestionJob:

    aws bedrock-agent start-ingestion-job \ --knowledge-base-id <knowledge-base-id> \ --data-source-id <data-source-id>

    Ersetzen Sie die Platzhalter durch:

    • <knowledge-base-id>- ID aus der Erstellung der Wissensdatenbank

    • <data-source-id>- ID aus der Erstellung der Datenquelle

  2. Überwachen Sie den Status des Aufnahmeauftrags mithilfe von. GetIngestionJob

Neusynchronisierung nach dem Löschen der Datenquelle

Wenn Sie eine Datenquelle löschen und ihren Inhalt aus der Wissensdatenbank entfernen möchten, müssen Sie die Wissensdatenbank explizit neu synchronisieren:

Um gelöschte Datenquelleninhalte zu entfernen
  1. Löschen Sie die Datenquelle mithilfe der Konsole oder DeleteDataSource API.

  2. Starten Sie einen neuen Aufnahmejob für alle verbleibenden Datenquellen, um die Vektordatenbank zu aktualisieren und Inhalte aus der gelöschten Datenquelle zu entfernen.

  3. Stellen Sie sicher, dass Abfragen keine Ergebnisse mehr aus der gelöschten Datenquelle zurückgeben.

Anmerkung

Ohne erneutes Synchronisieren werden Inhalte aus gelöschten Datenquellen weiterhin in den Suchergebnissen angezeigt, obwohl die Datenquelle nicht mehr existiert.