View a markdown version of this page

Personnalisation de l’ingestion pour une source de données - Amazon Bedrock

Les traductions sont fournies par des outils de traduction automatique. En cas de conflit entre le contenu d'une traduction et celui de la version originale en anglais, la version anglaise prévaudra.

Personnalisation de l’ingestion pour une source de données

Vous pouvez personnaliser l'ingestion de vecteurs lorsque vous connectez une source de données dans le Console de gestion AWS ou en modifiant la valeur du vectorIngestionConfiguration champ lors de l'envoi d'une CreateDataSource demande.

Sélectionnez une rubrique pour savoir comment inclure des configurations permettant de personnaliser l’ingestion lors de la connexion à une source de données :

Choisissez une stratégie d'analyse

Les bases de connaissances gérées prennent en charge deux stratégies d'analyse :

  • SMART_PARSING(par défaut) : stratégie d'analyse gérée par les services qui sélectionne automatiquement la meilleure approche d'analyse pour votre contenu. Il n'est pas nécessaire de configurer un modèle d'analyse ni de fournir des paramètres supplémentaires.

  • MULTI_MODAL_EMBEDDINGS— Envoie vos fichiers directement vers un modèle d'intégration multimodal natif au lieu de les analyser en texte. Utilisez cette stratégie uniquement lorsque votre base de connaissances utilise un modèle d'intégration multimodal natif, auquel cas c'est la seule stratégie prise en charge. Pour de plus amples informations, veuillez consulter Traitement multimodal natif.

Pour utiliser l'analyse syntaxique intelligente, vous pouvez soit omettre le parsingConfiguration champ duvectorIngestionConfiguration, soit le spécifier explicitement comme suit :

{ "parsingConfiguration": { "parsingStrategy": "SMART_PARSING" } }
Note

Les autres stratégies d'analyse, telles que BEDROCK_FOUNDATION_MODEL etBEDROCK_DATA_AUTOMATION, ne sont pas prises en charge pour les bases de connaissances gérées.

Choix d’une stratégie de découpage

Vous pouvez personnaliser la façon dont les documents contenus dans vos données sont découpés à des fins de stockage et d’extraction. Pour en savoir plus sur les options de découpage des données dans les bases de connaissances Amazon Bedrock, consultez Fonctionnement du découpage du contenu pour les bases de connaissances.

Note

Les stratégies de découpage s'appliquent au texte. Si votre base de connaissances utilise un modèle d'intégration multimodal natif, les fichiers sont envoyés directement au modèle d'intégration au lieu d'être analysés en texte. Ces stratégies de découpage ne s'appliquent donc pas. Vous contrôlez plutôt la façon dont les fichiers audio et vidéo sont divisés en segments. Pour de plus amples informations, veuillez consulter Traitement multimodal natif.

Avertissement

Une fois connecté à la source de données, vous ne pouvez plus modifier la stratégie de découpage.

Dans le, Console de gestion AWS vous choisissez la stratégie de découpage lors de la connexion à une source de données. Avec l'API Amazon Bedrock, vous incluez un ChunkingConfiguration dans le chunkingConfiguration champ du VectorIngestionConfiguration.

Si vous omettez cette configuration ou si vous spécifiez la stratégie de découpage par défaut, le service utilise un découpage de taille fixe avec 300 jetons et un chevauchement de 20 %.

{ "chunkingConfiguration": { "chunkingStrategy": "DEFAULT" } }

Développez la section qui correspond à la stratégie de découpage que vous souhaitez utiliser :

Pour traiter chaque document de votre source de données comme un bloc source unique, spécifiez NONE dans le champ chunkingStrategy de la ChunkingConfiguration, au format suivant :

{ "chunkingStrategy": "NONE" }

Pour diviser chaque document de votre source de données en morceaux d'environ la même taille, spécifiez FIXED_SIZE dans le chunkingStrategy champ ChunkingConfiguration et incluez un FixedSizeChunkingConfiguration dans le fixedSizeChunkingConfiguration champ, comme dans le format suivant :

{ "chunkingStrategy": "FIXED_SIZE", "fixedSizeChunkingConfiguration": { "maxTokens": number, "overlapPercentage": number } }
Note

Le découpage sémantique n'est pas pris en charge pour les bases de connaissances gérées.