Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Personalización de la ingesta de un origen de datos
Puede personalizar la ingesta de vectores al conectar una fuente de datos en el campo Consola de administración de AWS o modificando el valor del vectorIngestionConfiguration campo al enviar una solicitud. CreateDataSource
Seleccione un tema para obtener información acerca de cómo incluir configuraciones para personalizar la ingesta al conectarse a un origen de datos:
Elija una estrategia de análisis
Las bases de conocimiento administradas admiten dos estrategias de análisis:
-
SMART_PARSING(predeterminado): una estrategia de análisis administrada por el servicio que selecciona automáticamente el mejor enfoque de análisis para su contenido. No es necesario configurar un modelo de análisis ni proporcionar ajustes adicionales. -
MULTI_MODAL_EMBEDDINGS— Envía los archivos directamente a un modelo de incrustación multimodal nativo en lugar de analizarlos para convertirlos en texto. Utilice esta estrategia solo cuando su base de conocimientos utilice un modelo de incrustación multimodal nativo, en cuyo caso es la única estrategia compatible. Para obtener más información, consulte Procesamiento multimodal nativo.
Para utilizar el análisis inteligente, puede omitir el parsingConfiguration campo del o especificarlo explícitamente de la vectorIngestionConfiguration siguiente manera:
{ "parsingConfiguration": { "parsingStrategy": "SMART_PARSING" } }
nota
Otras estrategias de análisis, como BEDROCK_FOUNDATION_MODEL yBEDROCK_DATA_AUTOMATION, no son compatibles con las bases de conocimiento administradas.
Selección de una estrategia de fragmentación
Puede personalizar la forma en que se fragmentan los documentos de sus datos para su almacenamiento y recuperación. Para obtener más información sobre las opciones de fragmentación de datos en Bases de conocimiento de Amazon Bedrock, consulte Funcionamiento de la fragmentación de contenido para las bases de conocimiento.
nota
Las estrategias de fragmentación se aplican al texto. Si su base de conocimientos utiliza un modelo de incrustación multimodal nativo, los archivos se envían directamente al modelo de incrustación en lugar de analizarse para convertirlos en texto, por lo que estas estrategias de fragmentación no se aplican. En su lugar, tú controlas cómo se dividen los archivos de audio y vídeo en segmentos. Para obtener más información, consulte Procesamiento multimodal nativo.
aviso
No puede cambiar la configuración de fragmentación después de conectarse al origen de datos.
En el Consola de administración de AWS , usted elige la estrategia de fragmentación cuando se conecta a una fuente de datos. Con la API de Amazon Bedrock, incluyes una ChunkingConfiguration en el chunkingConfiguration campo de. VectorIngestionConfiguration
Si omite esta configuración o especifica la estrategia de fragmentación predeterminada, el servicio utiliza una fragmentación de tamaño fijo con 300 tokens y una superposición del 20%.
{ "chunkingConfiguration": { "chunkingStrategy": "DEFAULT" } }
Amplía la sección que corresponde a la estrategia de fragmentación que quieres usar:
Para tratar cada documento del origen de datos como un fragmento de origen único, especifique NONE en el campo chunkingStrategy de ChunkingConfiguration, como en el siguiente formato:
{ "chunkingStrategy": "NONE" }
Para dividir cada documento de la fuente de datos en fragmentos de aproximadamente el mismo tamaño, especifique FIXED_SIZE en el chunkingStrategy campo del ChunkingConfiguration e incluya un FixedSizeChunkingConfiguration en el fixedSizeChunkingConfiguration campo, como en el siguiente formato:
{ "chunkingStrategy": "FIXED_SIZE", "fixedSizeChunkingConfiguration": { "maxTokens": number, "overlapPercentage": number } }
nota
Las bases de conocimiento gestionadas no admiten la fragmentación semántica.