本文属于机器翻译版本。若本译文内容与英语原文存在差异,则一律以英文原文为准。
自定义数据来源的摄取
您可以在中连接数据源时自定义矢量摄取, AWS 管理控制台 也可以在发送CreateDataSource请求时修改vectorIngestionConfiguration字段的值。
选择一个主题,了解如何在连接到数据来源时,将自定义摄取所需的配置包括在内:
选择解析策略
托管知识库支持两种解析策略:
-
SMART_PARSING(默认)— 一种服务管理的解析策略,可自动为您的内容选择最佳的解析方法。您无需配置解析模型或提供其他设置。 -
MULTI_MODAL_EMBEDDINGS— 将文件直接发送到原生多模态嵌入模型,而不是将其解析为文本。仅当您的知识库使用原生多模态嵌入模型时才使用此策略,在这种情况下,它是唯一支持的策略。有关更多信息,请参阅 原生多模态处理。
要使用智能解析,您可以从中省略该parsingConfiguration字段vectorIngestionConfiguration,也可以按如下方式明确指定该字段:
{ "parsingConfiguration": { "parsingStrategy": "SMART_PARSING" } }
注意
托管知识库不支持其他解析策略BEDROCK_DATA_AUTOMATION,例如BEDROCK_FOUNDATION_MODEL和。
选择分块策略
您可以自定义如何对数据中的文档进行分块,以进行存储和检索。要了解有关在 Amazon Bedrock 知识库中进行数据分块的选项,请参阅知识库的内容分块是如何运作的。
注意
分块策略适用于文本。如果您的知识库使用原生多模态嵌入模型,则文件将直接发送到嵌入模型,而不是解析为文本,因此这些分块策略不适用。相反,您可以控制如何将音频和视频文件划分为多个片段。有关更多信息,请参阅 原生多模态处理。
警告
连接到数据来源后,就无法更改分块策略。
在连接数据源时, AWS 管理控制台 您可以选择分块策略。使用亚马逊 Bedrock API,您可以在chunkingConfiguration字段ChunkingConfiguration中添加一个。 VectorIngestionConfiguration
如果您省略此配置或指定默认分块策略,则该服务将使用固定大小的分块,其中包含 300 个令牌和 20% 的重叠量。
{ "chunkingConfiguration": { "chunkingStrategy": "DEFAULT" } }
展开与您要使用的分块策略相对应的部分:
要将数据来源中的每个文档视为单个源分块,请在 ChunkingConfiguration 的 chunkingStrategy 字段中指定 NONE,格式如下:
{ "chunkingStrategy": "NONE" }
要将数据源中的每个文档分成大小大致相同的块,请在的chunkingStrategy字段FIXED_SIZE中指定,ChunkingConfiguration并在fixedSizeChunkingConfiguration字段FixedSizeChunkingConfiguration中包含 a,格式如下:
{ "chunkingStrategy": "FIXED_SIZE", "fixedSizeChunkingConfiguration": { "maxTokens": number, "overlapPercentage": number } }
注意
托管知识库不支持语义分块。