View a markdown version of this page

Native multimodale Verarbeitung - Amazon Bedrock

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Native multimodale Verarbeitung

Bei nativer multimodaler Verarbeitung sendet eine verwaltete Amazon Bedrock-Wissensdatenbank jede Datei direkt an ein multimodales Einbettungsmodell. Das Modell erstellt dann Einbettungen aus dem Rohbild-, Audio- und Videoinhalt.

Ohne ein natives multimodales Einbettungsmodell funktioniert eine Wissensdatenbank anders. Zuerst analysiert sie Ihre Dateien. Dann schneidet es den Text ab, den es aus ihnen extrahiert. Schließlich bettet es diese Chunks in ein Texteinbettungsmodell ein.

Bei der systemeigenen multimodalen Verarbeitung werden das Parsen und die Textextraktion übersprungen. Dadurch bleiben visuelle und akustische Details erhalten, die bei der Textextraktion verloren gehen würden.

Um die native multimodale Verarbeitung zu ermöglichen, wählen Sie bei der Erstellung der Wissensdatenbank ein systemeigenes multimodales Einbettungsmodell aus. Derzeit ist TwelveLabs Marengo Embed 3.0 (twelvelabs.marengo-embed-3-0-v1:0) das einzige Modell, das Sie wählen können. Anweisungen zur Konfiguration finden Sie unterErstellen einer verwalteten Wissensdatenbank.

So funktioniert die native multimodale Verarbeitung

Wenn Sie eine Wissensdatenbank mit einem systemeigenen multimodalen Einbettungsmodell konfigurieren, gilt Folgendes:

  • Nur die MULTI_MODAL_EMBEDDINGS Parsing-Strategie wird unterstützt. Sie können ein natives multimodales Einbettungsmodell nicht mit anderen Parsing-Strategien kombinieren.

  • Dateien werden direkt an das Einbettungsmodell gesendet. Das Einbettungsmodell verarbeitet die Rohdatei und erzeugt Einbettungen aus ihrem nativen Inhalt.

  • Text-based Chunking-Strategien werden nicht unterstützt. Da Ihre Dateien nicht in Text umgewandelt werden, gelten die für Text geltenden Aufteilstrategien, wie z. B. das Standard-Chunking und das Chunking mit fester Größe, nicht.

  • Sie können die Segmentierung für Audio und Video konfigurieren. Anstatt einer Strategie zur Textaufteilung wählen Sie, wie die Wissensdatenbank Audio- und Videodateien in Segmente aufteilt. Verwenden Sie die Segmentierungseinstellungen im Feld. modelConfiguration Weitere Informationen finden Sie unter Erstellen einer verwalteten Wissensdatenbank.

  • Nur die Dateitypen, die das Modell unterstützt, werden unterstützt. Eine Wissensdatenbank, die mit einem nativen multimodalen Einbettungsmodell konfiguriert ist, kann nur die Dateitypen aufnehmen, die das Modell akzeptiert. Informationen zu den TwelveLabs Marengo Embed 3.0 unterstützten Dateitypen und Einstellungen finden Sie unter. TwelveLabs Marengo Embed 3.0

  • Sie müssen ein multimodales Speicherziel angeben. Geben Sie einen Amazon S3-Speicherort an, an dem die Wissensdatenbank Ihre Inhalte verarbeiten und aufnehmen kann. Amazon Bedrock Knowledge Bases erstellt einen aws/ Präfixordner in Ihrem Bucket. Verwenden Sie einen anderen Bucket als Ihren Datenquellen-Bucket. Die Berechtigungen, die die Servicerolle benötigt, finden Sie unterBerechtigungen für Ihr multimodales Speicherziel.

  • Nur die Retrieve API wird unterstützt. Sie fragen mit der Operation eine Wissensdatenbank ab, die ein systemeigenes multimodales Einbettungsmodell verwendet. Retrieve Der RetrieveAndGenerate Vorgang wird nicht unterstützt.

  • Abfragen müssen aus Text bestehen. Sie fragen Ihre multimodalen Inhalte mithilfe von Text ab. Bildanfragen werden nicht unterstützt.

Einzelheiten zu den Metadaten, die der Retrieve Vorgang für multimodale Ergebnisse zurückgibt, und zum Abrufen der passenden Datei finden Sie unter. Rufen Sie Antworten für native multimodale Wissensdatenbanken ab

Wie die Wissensdatenbank das Einbettungsmodell aufruft

Wenn Sie ein systemeigenes multimodales Einbettungsmodell verwenden, ruft Ihre Wissensdatenbank dieses Modell sowohl synchron als auch asynchron auf. Es verwendet einen synchronen Aufruf, wenn Sie eine Abfrage senden, und einen asynchronen Aufruf, wenn es Ihren Inhalt aufnimmt. Ihre Servicerolle benötigt Berechtigungen für beide. Weitere Informationen zu der Richtlinie, die angehängt werden soll, finden Sie unterBerechtigungen für den Zugriff auf Amazon-Bedrock-Modelle.

Anmerkung

In einigen AWS-Regionen Fällen unterstützt das TwelveLabs Marengo Embed 3.0 Modell den synchronen Aufruf nur über ein Inferenzprofil. Beim asynchronen Aufruf wird weiterhin das On-Demand-Modell verwendet. Geben Sie in diesen Regionen ein Inferenzprofil an, wenn Sie die Wissensdatenbank erstellen. Die Wissensdatenbank verwendet dann sowohl das Inferenzprofil als auch das On-Demand-Modell, um Ihre Inhalte zu verarbeiten. Ihre Servicerolle benötigt Berechtigungen für beide.

Informationen dazu, wie TwelveLabs Marengo Embed 3.0 das von Ihnen verwendete System AWS-Region unterstützt wird, finden Sie unterTwelveLabs Marengo Embed 3.0.

Verwaltung transienter Daten mit Amazon S3-Lebenszyklusrichtlinien

Während Amazon Bedrock Knowledge Bases Ihre Inhalte verarbeitet, speichert es transiente Daten in Ihrem multimodalen Speicherziel. Es versucht, diese Daten zu löschen, wenn die Verarbeitung abgeschlossen ist. Um sicherzustellen, dass die Daten ablaufen, empfehlen wir, eine Lebenszyklusrichtlinie auf den transienten Datenpfad anzuwenden.

Console
So erstellen Sie mithilfe der Konsole eine Lebenszyklusregel
  1. Öffnen Sie die Amazon S3-Konsole.

  2. Navigieren Sie zu dem multimodalen Speicherziel, das Sie für Ihre Wissensdatenbank konfiguriert haben.

  3. Wählen Sie die Registerkarte „Verwaltung“ und dann „Lebenszyklusregel erstellen“.

  4. Geben Sie für den Namen der Lebenszyklusregel den Wert einTransient Data Deletion.

  5. Wählen Sie unter Filtertyp die Option Den Umfang dieser Regel mithilfe eines oder mehrerer Filter einschränken aus.

  6. Geben Sie unter Präfix den transienten Datenpfad für Ihre Wissensdatenbank und Datenquelle ein.

    Ersetzen Sie die Platzhalterwerte im folgenden Präfix durch Ihre tatsächlichen Bezeichner:

    aws/bedrock/knowledge_bases/knowledge-base-id/data-source-id/transient_data
    Löschen Sie keine multimodalen Inhalte

    Wenden Sie keine Lebenszyklusrichtlinien auf den gesamten Bucket oder das aws/ Präfix an, da dies Ihre multimodalen Inhalte löscht und zu Verarbeitungsfehlern führen kann. Verwenden Sie nur den transienten Datenpfad, der im vorherigen Präfixbeispiel gezeigt wurde.

  7. Wählen Sie unter Aktionen für Lebenszyklusregeln die Option Aktuelle Versionen von Objekten ablaufen lassen aus.

  8. Geben Sie für Tage nach der Objekterstellung den Wert ein1.

  9. Wählen Sie Regel erstellen aus.

AWS CLI
Um eine Lebenszyklusregel zu erstellen, verwenden Sie die AWS CLI
  1. Erstellen Sie eine JSON-Datei lifecycle-policy.json mit dem folgenden Namen und ersetzen Sie die Platzhalterwerte durch Ihre tatsächlichen Bezeichner:

    • knowledge-base-id— Ihre Wissensdatenbank-ID

    • data-source-id— Ihre Datenquellen-ID

    { "Rules": [ { "ID": "TransientDataDeletion", "Status": "Enabled", "Filter": { "Prefix": "aws/bedrock/knowledge_bases/knowledge-base-id/data-source-id/transient_data" }, "Expiration": { "Days": 1 } } ] }
  2. Wenden Sie die Lifecycle-Richtlinie auf Ihren Bucket an. amzn-s3-demo-bucketErsetzen Sie es durch den Namen Ihres multimodalen Speicher-Buckets:

    aws s3api put-bucket-lifecycle-configuration \ --bucket amzn-s3-demo-bucket \ --lifecycle-configuration file://lifecycle-policy.json
  3. Stellen Sie sicher, dass die Lebenszyklusrichtlinie angewendet wurde:

    aws s3api get-bucket-lifecycle-configuration \ --bucket amzn-s3-demo-bucket

Weitere Informationen zu den Amazon S3-Lebenszyklusrichtlinien finden Sie unter Managing the lifecycle of objects im Amazon S3-Benutzerhandbuch.