View a markdown version of this page

Crea una base di conoscenza per contenuti multimodali - Amazon Bedrock

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

Crea una base di conoscenza per contenuti multimodali

È possibile creare basi di conoscenza multimodali utilizzando la console o l'API. Scegli il tuo approccio in base alle tue esigenze di elaborazione multimodale.

Importante

Il supporto multimodale è disponibile solo quando si crea una knowledge base con fonti di dati non strutturate. Le fonti di dati strutturate non supportano l'elaborazione multimodale dei contenuti.

Console
Per creare una knowledge base multimodale dalla console
  1. Accedi Console di gestione AWS con un'identità IAM con le autorizzazioni per utilizzare la console Amazon Bedrock. Quindi, apri la console Amazon Bedrock all'indirizzo. https://console.aws.amazon.com/bedrock

  2. Nel riquadro di navigazione a sinistra, scegli Knowledge base.

  3. Nella sezione Knowledge base, scegli Crea, quindi scegli Knowledge base con archivio vettoriale.

  4. (Opzionale) In Dettagli della knowledge base, modifica il nome predefinito e fornisci una descrizione per la tua knowledge base.

  5. In Autorizzazioni IAM, scegli un ruolo IAM che fornisca ad Amazon Bedrock l’autorizzazione per accedere ad altri servizi Servizi AWS necessari. Puoi fare in modo che Amazon Bedrock crei il ruolo del servizio per te oppure puoi scegliere di utilizzare il tuo ruolo personalizzato. Per le autorizzazioni multimodali, consulta. Autorizzazioni per contenuti multimodali

  6. Scegli Amazon S3 come origine dati e scegli Avanti per configurare l'origine dati.

    Nota

    Puoi aggiungere fino a 5 fonti di dati Amazon S3 durante la creazione della knowledge base. È possibile aggiungere ulteriori fonti di dati dopo la creazione della knowledge base.

  7. Fornisci l'URI S3 del bucket contenente il contenuto multimodale e configura un prefisso di inclusione, se necessario. Il prefisso di inclusione è un percorso di cartella che può essere utilizzato per limitare il contenuto che viene inserito.

  8. In Chunking and parsing configurations, scegli la tua strategia di analisi:

    • Parser predefinito Bedrock: consigliato per l'elaborazione di contenuti di solo testo. Questo parser elabora i formati di testo più comuni ignorando i file multimodali. Supporta documenti di testo tra cui file Word, Excel, HTML, Markdown, TXT e CSV.

    • Bedrock Data Automation (BDA): converte i contenuti multimodali in rappresentazioni testuali ricercabili. Elabora PDF, immagini, file audio e video per estrarre testo, generare descrizioni per contenuti visivi e creare trascrizioni per contenuti audio e video.

    • Foundation model parser: fornisce funzionalità di analisi avanzate per strutture di documenti complesse. Elabora PDF, immagini, documenti strutturati, tabelle e contenuti visivamente ricchi per estrarre testo e generare descrizioni per elementi visivi.

  9. Scegliete Avanti e selezionate il modello di incorporamento e l'approccio di elaborazione multimodale.

    • Incorporamenti multimodali Amazon Nova V1.0: scegli l'incorporamento di Amazon Nova V1.0 per ricerche dirette di similarità visive e audio. Configura la durata dei blocchi audio e video (1-30 secondi, impostazione predefinita 5 secondi) per controllare la segmentazione dei contenuti.

      Nota

      I parametri di suddivisione in blocchi audio e video sono configurati a livello di modello di incorporamento, non a livello di origine dati. Si verifica un’eccezione di convalida se si fornisce questa configurazione per modelli di embedding non multimodali. Configura la durata dei blocchi audio e video (impostazione predefinita: 5 secondi, intervallo: 1-30 secondi) per controllare la segmentazione dei contenuti. I blocchi più corti consentono un recupero preciso dei contenuti, mentre i blocchi più lunghi preservano un contesto più semantico.

      Importante

      Amazon Nova Embedding v1.0 ha un supporto limitato per la ricerca di contenuti vocali nei dati. audio/video Se devi supportare il riconoscimento vocale, utilizza Bedrock Data Automation come parser.

    • Incorporamenti di testo con BDA: scegli un modello di incorporamento del testo (come Titan Text Embeddings v2) quando usi l'elaborazione BDA. I modelli di incorporamento del testo limitano il recupero ai contenuti di solo testo, ma puoi abilitare il recupero multimodale selezionando Data Automation o Foundation Model come parser. Amazon Bedrock

      Nota

      Se utilizzi il parser BDA con Nova Multimodal Embeddings, Amazon Bedrock Knowledge Bases eseguirà prima l'analisi BDA. In questo caso, il modello di incorporamento non genererà incorporamenti multimodali nativi per immagini, audio e video poiché BDA li converte in rappresentazioni di testo.

  10. Se utilizzi Nova Multimodal Embeddings, configura la destinazione di archiviazione multimodale specificando un bucket Amazon S3 in cui i file elaborati verranno archiviati per il recupero. Le Knowledge Bases memorizzeranno le immagini analizzate in un singolo bucket Amazon S3 con una cartella creata .bda per un facile accesso.

    Raccomandazione sulle politiche relative al ciclo di vita

    Quando si utilizza Nova Multimodal Embeddings, Amazon Bedrock archivia i dati transitori nella destinazione di archiviazione multimodale e tenta di eliminarli una volta completata l'elaborazione. Consigliamo di applicare una politica del ciclo di vita sul percorso dei dati transitori per garantire una corretta pulizia. Per istruzioni dettagliate, vedi Gestione dei dati transitori con le policy relative al ciclo di vita di Amazon S3.

  11. Nella sezione Database vettoriale, scegliete il metodo di archiviazione vettoriale e configurate le dimensioni appropriate in base al modello di incorporamento selezionato.

  12. Scegli Avanti e rivedi i dettagli della configurazione della tua knowledge base, quindi scegli Crea knowledge base.

CLI
Per creare una knowledge base multimodale utilizzando AWS CLI
  • Crea una base di conoscenza con Nova Multimodal Embeddings. Invia una richiesta: CreateKnowledgeBase

    aws bedrock-agent create-knowledge-base \ --cli-input-json file://kb-nova-mme.json

    Contenuto di kb-nova-mme.json (sostituisci i valori segnaposto con la tua configurazione specifica):

    { "knowledgeBaseConfiguration": { "vectorKnowledgeBaseConfiguration": { "embeddingModelArn": "arn:aws:bedrock:us-east-1::foundation-model/amazon.nova-2-multimodal-embeddings-v1:0", "supplementalDataStorageConfiguration": { "storageLocations": [ { "type": "S3", "s3Location": { "uri": "s3://<multimodal-storage-bucket>/" } } ] } }, "type": "VECTOR" }, "storageConfiguration": { "opensearchServerlessConfiguration": { "collectionArn": "arn:aws:aoss:us-east-1:<account-id>:collection/<collection-id>", "vectorIndexName": "<index-name>", "fieldMapping": { "vectorField": "<vector-field>", "textField": "<text-field>", "metadataField": "<metadata-field>" } }, "type": "OPENSEARCH_SERVERLESS" }, "name": "<knowledge-base-name>", "description": "Multimodal knowledge base with Nova Multimodal Embeddings" }

    Sostituire i seguenti segnaposto:

    • <multimodal-storage-bucket>- Bucket S3 per l'archiviazione di file multimodali

    • <account-id>- L'ID del tuo account AWS

    • <collection-id>- ID di raccolta OpenSearch serverless

    • <index-name>- Nome dell'indice vettoriale nella OpenSearch raccolta (configurato con dimensioni appropriate per il modello di incorporamento scelto)

    • <vector-field>- Nome del campo per la memorizzazione degli incorporamenti

    • <text-field>- Nome del campo per la memorizzazione del contenuto testuale

    • <metadata-field>- Nome del campo per la memorizzazione dei metadati