Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
Aggiungere fonti di dati e iniziare l'ingestione
Dopo aver creato la tua knowledge base, aggiungi le fonti di dati contenenti i tuoi contenuti multimodali e avvia i processi di inserimento per elaborare e indicizzare il contenuto.
Comportamento di eliminazione delle origini dati
Quando si elimina un'origine dati con la politica di eliminazione impostata su RETAIN, il contenuto inserito rimane nel database vettoriale e continuerà a essere utilizzato per il recupero. Il contenuto viene rimosso solo se si sincronizza esplicitamente la knowledge base dopo aver eliminato l'origine dati. Le origini dati con il criterio DELETE predefinito rimuoveranno automaticamente il contenuto dal database vettoriale e dalla memoria supplementare durante l'eliminazione. Ciò garantisce che la knowledge base continui a funzionare anche se i file sorgente vengono modificati o eliminati. Tuttavia, le origini dati eliminate con la politica RETAIN potrebbero comunque contribuire ai risultati della ricerca.
Aggiungere fonti di dati
Aggiungi fonti di dati contenenti i tuoi contenuti multimodali alla tua knowledge base.
Per le origini dati BDA: solo le fonti di dati create dopo l'avvio del audio/video supporto elaboreranno i file audio e video. Le sorgenti dati BDA esistenti create prima del lancio di questa funzionalità continueranno a ignorare i file audio e video. Per consentire audio/video l'elaborazione delle knowledge base esistenti, create nuove fonti di dati.
- Console
-
Per aggiungere una fonte di dati dalla console
-
Dalla pagina dei dettagli della tua knowledge base, scegli Aggiungi origine dati.
-
Scegli Amazon S3 come tipo di origine dati.
-
Fornisci un nome e una descrizione per la tua fonte di dati.
-
Configura la posizione Amazon S3 contenente i tuoi file multimodali fornendo l'URI del bucket e gli eventuali prefissi di inclusione.
-
In Content parsing and chunking, configura i tuoi metodi di analisi e suddivisione in blocchi:
I modelli di incorporamento del testo limitano il recupero ai contenuti di solo testo. Tuttavia, puoi abilitare il recupero multimodale tramite testo selezionando Amazon Bedrock Data Automation (per audio, video e immagini) o Foundation Model come parser (per immagini).
Scegli tra tre strategie di analisi:
-
Parser predefinito Bedrock: consigliato per l'analisi di solo testo. Questo parser ignora il contenuto multimodale ed è comunemente usato con i modelli di incorporamento multimodale.
-
Bedrock Data Automation come parser: consente l'analisi e l'archiviazione di contenuti multimodali come testo, supportando PDF, immagini, file audio e video.
-
Modello base come parser: fornisce un'analisi avanzata per immagini e documenti strutturati, supportando PDF, immagini, tabelle e documenti visivamente ricchi.
-
Scegli Aggiungi origine dati per creare l'origine dati.
- CLI
-
Per aggiungere un'origine dati utilizzando AWS CLI
-
Crea un'origine dati per i tuoi contenuti multimodali. Invia una CreateDataSource richiesta:
aws bedrock-agent create-data-source \
--knowledge-base-id <knowledge-base-id> \
--cli-input-json file://ds-multimodal.json
Per Nova Multimodal Embeddings (non è necessaria alcuna configurazione di analisi speciale), usa questo contenuto: ds-multimodal.json
{
"dataSourceConfiguration": {
"type": "S3",
"s3Configuration": {
"bucketArn": "arn:aws:s3:::<data-source-bucket>",
"inclusionPrefixes": ["<folder-path>"]
}
},
"name": "multimodal_data_source",
"description": "Data source with multimodal content",
"dataDeletionPolicy": "RETAIN"
}
Per l'approccio di analisi BDA, usa questa configurazione:
{
"dataSourceConfiguration": {
"type": "S3",
"s3Configuration": {
"bucketArn": "arn:aws:s3:::<data-source-bucket>",
"inclusionPrefixes": ["<folder-path>"]
}
},
"name": "multimodal_data_source_bda",
"description": "Data source with BDA multimodal parsing",
"dataDeletionPolicy": "RETAIN",
"vectorIngestionConfiguration": {
"parsingConfiguration": {
"bedrockDataAutomationConfiguration": {
"parsingModality": "MULTIMODAL"
}
}
}
}
Avvio di un processo di importazione
Dopo aver aggiunto le fonti di dati, avviate un processo di inserimento per elaborare e indicizzare i contenuti multimodali.
- Console
-
Per avviare l'importazione dalla console
-
Dalla pagina dei dettagli dell'origine dati, scegli Sincronizza.
-
Monitora lo stato della sincronizzazione nella pagina dell'origine dati. L'inserimento può richiedere diversi minuti a seconda delle dimensioni e del numero dei file multimodali.
-
Una volta completata la sincronizzazione, il contenuto multimodale è pronto per essere interrogato.
- CLI
-
Per iniziare l'ingestione, utilizzare AWS CLI
-
Avviare un processo di ingestione. Invia una StartIngestionJob richiesta:
aws bedrock-agent start-ingestion-job \
--knowledge-base-id <knowledge-base-id> \
--data-source-id <data-source-id>
Sostituisci i segnaposto con:
-
Monitora lo stato del processo di acquisizione utilizzando. GetIngestionJob
Risincronizzazione dopo l'eliminazione dell'origine dati
Se si elimina un'origine dati e si desidera rimuoverne il contenuto dalla knowledge base, è necessario risincronizzare esplicitamente la knowledge base:
Per rimuovere il contenuto dell'origine dati eliminato
-
Elimina l'origine dati utilizzando la console o l'DeleteDataSourceAPI.
-
Avvia un nuovo processo di inserimento su tutte le origini dati rimanenti per aggiornare il database vettoriale e rimuovere il contenuto dall'origine dati eliminata.
-
Verifica che le query non restituiscano più risultati dall'origine dati eliminata.
Senza la risincronizzazione, il contenuto delle origini dati eliminate continuerà a essere visualizzato nei risultati di ricerca anche se l'origine dati non esiste più.