As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
Personalizar a ingestão para uma fonte de dados
Você pode personalizar a ingestão vetorial ao conectar uma fonte de dados no Console de gerenciamento da AWS ou modificando o valor do vectorIngestionConfiguration campo ao enviar uma CreateDataSource solicitação.
Selecione um tópico para saber como incluir configurações para personalizar a ingestão ao se conectar a uma fonte de dados:
Escolha uma estratégia de análise
As bases de conhecimento gerenciadas suportam duas estratégias de análise:
-
SMART_PARSING(padrão) — Uma estratégia de análise gerenciada por serviços que seleciona automaticamente a melhor abordagem de análise para seu conteúdo. Você não precisa configurar um modelo de análise nem fornecer configurações adicionais. -
MULTI_MODAL_EMBEDDINGS— Envia seus arquivos diretamente para um modelo nativo de incorporação multimodal em vez de analisá-los em texto. Use essa estratégia somente quando sua base de conhecimento usa um modelo nativo de incorporação multimodal. Nesse caso, essa é a única estratégia suportada. Para obter mais informações, consulte Processamento multimodal nativo.
Para usar a análise inteligente, você pode omitir o parsingConfiguration campo do vectorIngestionConfiguration ou especificá-lo explicitamente da seguinte forma:
{ "parsingConfiguration": { "parsingStrategy": "SMART_PARSING" } }
nota
Outras estratégias de análise, como BEDROCK_FOUNDATION_MODEL eBEDROCK_DATA_AUTOMATION, não são suportadas por bases de conhecimento gerenciadas.
Escolher uma estratégia de fragmentação
Você pode personalizar a forma como os documentos em sua fontes de dados são agrupados para armazenamento e recuperação. Para saber mais sobre as opções para fragmentar dados nas Bases de Conhecimento do Amazon Bedrock, consulte Como a fragmentação de conteúdo funciona para bases de conhecimento.
nota
As estratégias de fragmentação se aplicam ao texto. Se sua base de conhecimento usa um modelo de incorporação multimodal nativo, os arquivos são enviados diretamente para o modelo de incorporação em vez de serem analisados em texto, portanto, essas estratégias de fragmentação não se aplicam. Em vez disso, você controla como os arquivos de áudio e vídeo são divididos em segmentos. Para obter mais informações, consulte Processamento multimodal nativo.
Atenção
Não será possível alterar a estratégia de fragmentação após a conexão da fonte de dados.
No, Console de gerenciamento da AWS você escolhe a estratégia de fragmentação ao se conectar a uma fonte de dados. Com a API Amazon Bedrock, você inclui um ChunkingConfiguration no chunkingConfiguration campo do VectorIngestionConfiguration.
Se você omitir essa configuração ou especificar a estratégia de fragmentação padrão, o serviço usará a fragmentação de tamanho fixo com 300 tokens e 20% de sobreposição.
{ "chunkingConfiguration": { "chunkingStrategy": "DEFAULT" } }
Expanda a seção que corresponde à estratégia de fragmentação que você deseja usar:
Para tratar cada documento em sua fonte de dados como um único fragmento de origem, especifique NONE no campo chunkingStrategy de ChunkingConfiguration, conforme o seguinte formato:
{ "chunkingStrategy": "NONE" }
Para dividir cada documento em sua fonte de dados em partes de aproximadamente o mesmo tamanho, especifique FIXED_SIZE no chunkingStrategy campo do ChunkingConfiguration e inclua um FixedSizeChunkingConfiguration no fixedSizeChunkingConfiguration campo, conforme o formato a seguir:
{ "chunkingStrategy": "FIXED_SIZE", "fixedSizeChunkingConfiguration": { "maxTokens": number, "overlapPercentage": number } }
nota
A fragmentação semântica não é compatível com bases de conhecimento gerenciadas.