View a markdown version of this page

Erstellen einer verwalteten Wissensdatenbank - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Erstellen einer verwalteten Wissensdatenbank

Wenn Sie eine verwaltete Wissensdatenbank erstellen, AgentCore verwaltet Amazon Bedrock die Speicher-, Indexierungs- und Abrufinfrastruktur für Sie. Standardmäßig wird ein vom Service verwaltetes Einbettungsmodell verwendet, und es ist keine Modellauswahl oder -konfiguration erforderlich. Sie können stattdessen optional Ihr eigenes Bedrock-Einbettungsmodell bereitstellen. Sie können optional auch einen KMS-Schlüssel für die Verschlüsselung des verwalteten Vektorspeichers angeben.

Nachdem Sie die Wissensdatenbank erstellt haben, verbinden Sie sie mit einer Datenquelle und beginnen Sie mit der Erfassung. Einzelheiten zum Verbinden einer Datenquelle finden Sie unter Verbinden einer Datenquelle. Verwenden Sie die StartIngestionJob API, um eine Datenquelle zu synchronisieren. Details hierzu finden Sie unter Synchronisieren Sie Ihre Datenquelle mit Ihrer Amazon Bedrock-Wissensdatenbank.

Anmerkung

Nachdem Sie eine verwaltete Wissensdatenbank erstellt und synchronisiert haben, verwenden Sie die Retrieve API, um sie abzufragen. Geben Sie in dem retrievalConfiguration Feld anmanagedSearchConfiguration. Das vectorSearchConfiguration Feld gilt nur für benutzerdefinierte Wissensdatenbanken. Beispiele für Anfragen und weitere Überlegungen finden Sie unterAbrufen einer Wissensdatenbank und Datenabruf.

Um zu erfahren, wie Sie eine verwaltete Wissensdatenbank erstellen, wählen Sie den Tab für Ihre bevorzugte Methode:

Console
Um eine verwaltete Wissensdatenbank zu erstellen
  1. Melden Sie sich bei der an AWS-Managementkonsole und navigieren Sie zu Amazon Bedrock AgentCore > Built-in Tools > Knowledge Base.

  2. Wählen Sie „Verwaltete Wissensdatenbank erstellen“.

  3. (Optional) Erweitern Sie den Abschnitt Zusätzliche Konfigurationen der Knowledge Base-Details, um Folgendes zu konfigurieren:

    • Fügen Sie eine Beschreibung hinzu.

    • Wählen Sie einen Einbettungsmodelltyp aus:

      • Verwaltet (Standard): Ein dienstverwaltetes Einbettungsmodell wird verwendet. Es ist keine Modellauswahl oder Konfiguration erforderlich.

      • Benutzerdefiniert: Wählen Sie ein Bedrock-Einbettungsmodell aus. Wählen Sie das Modell aus, um die Modellauswahl zu öffnen, in der die verfügbaren Anbieter (Amazon, Cohere) und Modelle angezeigt werden.

      • Benutzerdefiniertes multimodales Einbettungsmodell: Wählen Sie ein multimodales Einbettungsmodell aus. Derzeit wird nur TwelveLabs Marengo Embed 3.0 unterstützt. Dieses Modell verarbeitet nativ Bild-, Audio- und Videodateien. Wenn Sie sich für dieses Modell entscheiden, müssen Sie auch ein multimodales Speicherziel angeben — den Amazon S3-Bucket, der für die Verarbeitung und Aufnahme Ihrer multimodalen Inhalte verwendet wird. Amazon Bedrock Knowledge Bases erstellt in Ihrem Bucket einen aws/ Präfixordner für den einfachen Zugriff. Weitere Informationen finden Sie unter Native multimodale Verarbeitung.

    • IAM-Berechtigungen konfigurieren: Wählen Sie Neue Servicerolle erstellen und verwenden (empfohlen) oder wählen Sie eine vorhandene Rolle aus.

    • Konfigurieren Sie die AWS KMS Verschlüsselung für den verwalteten Vector Store (standardmäßig AWS verwalteter Schlüssel, oder wählen Sie einen benutzerdefinierten KMS-Schlüssel aus).

  4. Geben Sie unter Datenquelle einen Datenquellennamen ein.

  5. Wählen Sie Ihren Datenquellentyp aus der Drop-down-Liste aus: Amazon S3, Confluence, Benutzerdefiniert, Google Drive oder Web OneDrive SharePoint Crawler.

  6. Konfigurieren Sie die Verbindungseinstellungen für die Datenquelle für den ausgewählten Datenquellentyp.

  7. (Optional) Erweitern Sie Inhaltsanalyse und Chunking, um Folgendes zu konfigurieren:

    • Die Analysestrategie ist standardmäßig auf Managed Parser eingestellt.

    • Wählen Sie aus dem Drop-down-Menü eine Strategie zum Aufteilen von Text aus:

      • Standard-Chunking (empfohlen): Teilt Text in Abschnitte mit fester Größe auf.

      • Fixed-size Chunking: Teilt den Text in die von Ihnen festgelegte ungefähre Token-Größe auf.

      • Kein Chunking: Für vorverarbeitete oder vorab geteilte Dokumente.

  8. (Optional) Erweitern Sie Erweiterte Konfigurationen, um die erweiterte Indizierung zu konfigurieren. Unter Inhaltsindizierung indexiert die Standardeinstellung textbasierte Inhalte aus gängigen Dokumenten. Aktiviere die erweiterte Indizierung für zusätzliche Modalitäten:

    • Visueller Inhalt in Dokumenten: Verarbeitet eigenständige Bilddateien (.png, .jpg, .jpeg, .jpe, .tif, .tiff, .gif, .bmp, .webp, .svg, .jp2, .heic) und eingebettete Grafiken in .pdf-, .docx-, .ppt-, .pptx-Dateien.

    • Audiodateien: Verarbeitet Dateien im Format.mp3, .wav, .m4a, .flac, .ogg.

    • Videodateien: Verarbeitet .mp4-, .mov-, .m4v-Dateien.

    Legen Sie optional eine maximale Dateigröße (MB) fest und konfigurieren Sie den Schutz vor dem Löschen von Dokumenten.

  9. (Optional) Konfigurieren Sie die Protokollzustellung, um die Aufnahmeprotokolle der Wissensdatenbank an ein Ziel wie CloudWatch Logs, Amazon S3 oder Firehose zu senden.

  10. Wählen Sie „Wissensdatenbank erstellen“.

  11. Warten Sie, bis die Wissensdatenbank und die Datenquelle erstellt sind (2—5 Minuten). Wenn Sie eine verwaltete Wissensdatenbank mit einem vom Kunden verwalteten Schlüssel erstellen, kann die Erstellung länger dauern.

API

Im Folgenden finden Sie ein Beispiel für die Erstellung einer verwalteten Wissensdatenbank und die Konfiguration Ihrer Datenquelle mithilfe der API mit dem AWS CLI oder einem unterstützten SDK wie Python. Nach dem Anruf rufen Sie auf CreateKnowledgeBase, CreateDataSource um Ihre Datenquelle mit Ihren Verbindungsinformationen zu erstellendataSourceConfiguration.

Weitere Informationen zu Anpassungen, die Sie auf die Erfassung anwenden können, indem Sie das optionale vectorIngestionConfiguration-Feld einbeziehen, finden Sie unter So passen Sie die Aufnahme für eine Datenquelle an.

AWS Command Line Interface

Schritt 1: Erstellen Sie die Wissensdatenbank

Mit einem verwalteten Einbettungsmodell (Standard):

aws bedrock-agent create-knowledge-base \ --name "my-managed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "MANAGED" } }

Mit einem benutzerdefinierten Einbettungsmodell (vom Kunden bereitgestelltes Bedrock-Modell):

aws bedrock-agent create-knowledge-base \ --name "my-custom-embed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base with custom embedding" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "CUSTOM", "embeddingModelArn": "arn:aws:bedrock:us-west-2::foundation-model/amazon.titan-embed-text-v2:0", "embeddingModelConfiguration": { "bedrockEmbeddingModelConfiguration": { "dimensions": 1024 } } } }
Anmerkung

Wenn es weggelassen embeddingModelType wird, ist es standardmäßig auf. MANAGED Bei der Verwendung MANAGED dürfen Sie embeddingModelArn oder embeddingModelConfiguration nicht angeben. Bei Verwendung CUSTOM sind beide Felder erforderlich.

Mit einem benutzerdefinierten multimodalen Einbettungsmodell ()TwelveLabs Marengo Embed 3.0:

Ein multimodales Einbettungsmodell verwendet dasselbe CUSTOM embeddingModelType wie ein Texteinbettungsmodell. Der Unterschied besteht darin, dass ein zusätzliches modelConfiguration Feld bedrockEmbeddingModelConfiguration akzeptiert wird, in das Sie modellspezifische Einstellungen übergeben, und dass Sie ein Ziel supplementalDataStorageConfiguration für Ihr multimodales Speicherziel angeben müssen.

aws bedrock-agent create-knowledge-base \ --name "my-multimodal-embed-kb" \ --role-arn "arn:aws:iam::123456789012:role/BedrockKBRole" \ --description "My managed knowledge base with multimodal embedding" \ --knowledge-base-configuration file://kb-config.json kb-config.json { "type": "MANAGED", "managedKnowledgeBaseConfiguration": { "embeddingModelType": "CUSTOM", "embeddingModelArn": "arn:aws:bedrock:us-east-1::foundation-model/twelvelabs.marengo-embed-3-0-v1:0", "embeddingModelConfiguration": { "bedrockEmbeddingModelConfiguration": { "embeddingDataType": "FLOAT", "modelConfiguration": { "version": "1", "audio": { "segmentation": { "method": "dynamic", "dynamic": { "minDurationSec": 4 } } }, "video": { "segmentation": { "method": "fixed", "fixed": { "durationSec": 6 } } } } } }, "supplementalDataStorageConfiguration": { "storageLocations": [ { "s3Location": { "uri": "s3://amzn-s3-demo-bucket" }, "type": "S3" } ] } } }

Das modelConfiguration Feld ist ein JSON-Objekt, dessen Inhalt spezifisch für das von Ihnen gewählte Einbettungsmodell ist. Das version Feld ist erforderlich und muss auf gesetzt werden. 1 Für jede der audio video UND-Modalitäten können Sie entweder ein segmentation method oder festlegendynamic, das einen minDurationSec Wert annimmt, oderfixed, das einen durationSec Wert annimmt. Die Einstellungen, die TwelveLabs Marengo Embed 3.0 akzeptiert werden, finden Sie unterTwelveLabs Marengo Embed 3.0.

Anmerkung

Sie müssen eine angebensupplementalDataStorageConfiguration, wenn Sie das TwelveLabs Marengo Embed 3.0 Modell verwenden.

Schritt 2: Erstellen Sie eine Datenquelle

aws bedrock-agent create-data-source \ --name "S3-connector" \ --description "S3 data source connector for Amazon Bedrock to use content in S3" \ --knowledge-base-id "your-knowledge-base-id" \ --data-source-configuration file://bedrock-s3-managed-connector-configuration.json \ --data-deletion-policy "DELETE" \ --vector-ingestion-configuration '{"parsingConfiguration":{"parsingStrategy":"SMART_PARSING"}}' bedrock-s3-managed-connector-configuration.json { "type": "MANAGED_KNOWLEDGE_BASE_CONNECTOR", "managedKnowledgeBaseConnectorConfiguration": { "mediaExtractionConfiguration": { "imageExtractionConfiguration": { "imageExtractionStatus": "ENABLED" } }, "connectorParameters": { "type": "S3", "version": "1", "connectionConfiguration": { "bucketName": "your-test-s3-bucket", "bucketOwnerAccountId": "123456789012" }, "deletionProtectionConfiguration": { "enableDeletionProtection": false } } } }

Modelloptionen einbetten

Verwaltete Wissensdatenbanken unterstützen die folgenden Einbettungsmodelltypen:

  • Verwaltete Einbettung (Standard) — Ein dienstverwaltetes Einbettungsmodell wird automatisch verwendet. Sie müssen kein Modell auswählen, Dimensionen konfigurieren oder Bedrock-Servicelimits für das Einbetten verwalten. Der Service wickelt die Modellauswahl, das Hosting und die Skalierung transparent ab.

  • Benutzerdefinierte Einbettung — Sie stellen Ihren eigenen ARN für das Bedrock-Einbettungsmodell bereit. Wenn Sie ein benutzerdefiniertes Einbettungsmodell verwenden, müssen Sie die Modellabmessungen (1024) und den Float32-Einbettungsdatentyp angeben. Die folgenden Bedrock-Einbettungsmodelle werden unterstützt:

    • Amazon Titan Text Embeddings V2

    • Cohere Embed, Englisch, Version 3

    • Cohere Embed Mehrsprachig v3

    • Cohere Embed v4

    • Multimodale Einbettungen von Amazon Nova

  • Benutzerdefinierte multimodale Einbettung — Sie geben den ARN eines multimodalen Einbettungsmodells an, das neben Text auch Bild-, Audio- und Videodateien nativ verarbeitet. Derzeit ist TwelveLabs Marengo Embed 3.0 (twelvelabs.marengo-embed-3-0-v1:0) das einzige unterstützte multimodale Einbettungsmodell. Für diese Option ist ein multimodales Speicherziel erforderlich.

Anmerkung

Sie können den Einbettungsmodelltyp nicht mehr ändern, nachdem Sie die Wissensdatenbank erstellt haben. Um zwischen verwalteter und benutzerdefinierter Einbettung zu wechseln, müssen Sie eine neue Wissensdatenbank erstellen.

Wichtig

Wenn Sie eine Wissensdatenbank mit einem benutzerdefinierten Einbettungsmodell erstellen, ist der verwaltete Reranker für diese Wissensdatenbank nicht verfügbar. Um den verwalteten Reranker zu verwenden, erstellen Sie Ihre Wissensdatenbank mit dem standardmäßigen verwalteten Einbettungsmodell.

Unterstützte Datenquellen-Konnektoren

Verwaltete Wissensdatenbanken unterstützen die folgenden Datenquellen-Connectors:

  • Amazon S3

  • Box (Kasten)

  • Confluence Cloud

  • Confluence-Rechenzentrum

  • Microsoft Online SharePoint

  • Google Drive

  • Microsoft OneDrive

  • ServiceNow

  • Webcrawler

  • Benutzerdefinierter Anschluss

Informationen zur Konfiguration von Datenquellen-Connectoren finden Sie unter Eine Datenquelle verbinden.