Las traducciones son generadas a través de traducción automática. En caso de conflicto entre la traducción y la version original de inglés, prevalecerá la version en inglés.
Solución de problemas de bases de conocimiento multimodales
Esta sección proporciona orientación para resolver los problemas comunes que surgen al trabajar con bases de conocimiento multimodales. La información de solución de problemas se organiza según las limitaciones generales, los escenarios de error comunes con sus causas y soluciones, y las recomendaciones de optimización del rendimiento. Utilice esta información para diagnosticar y resolver problemas durante la configuración, la ingesta o la consulta de su contenido multimodal.
Limitaciones generales
Tenga en cuenta estas limitaciones actuales cuando trabaje con bases de conocimiento multimodales:
-
Límites de tamaño de archivo: máximo 1,5 GB por archivo de vídeo, 1 GB por archivo de audio (Nova Multimodal Embeddings) o 1,5 GB por archivo (BDA)
-
Archivos por trabajo de incorporación: máximo de 15 000 archivos por trabajo (incrustaciones multimodales de Nova) o 1000 archivos por trabajo (BDA)
-
Límites de consulta: máximo de una imagen por consulta
-
Restricciones en las fuentes de datos: solo Amazon S3 y las fuentes de datos personalizadas admiten contenido multimodal
-
Limitaciones de la segmentación de BDA: cuando se utiliza Bedrock Data Automation con una segmentación de tamaño fijo, la configuración del porcentaje de superposición no se aplica al contenido de audio y vídeo
-
Límites de trabajos simultáneos de BDA: límite predeterminado de 20 trabajos de BDA simultáneos. Para el procesamiento a gran escala, considere solicitar un aumento de la cuota de servicio
-
Limitaciones del modelo de cambio de clasificación: los modelos de cambio de clasificación no son compatibles con el contenido multimodal
-
Limitaciones de resumen: no se admite el resumen de las respuestas de recuperación que contienen contenido que no sea texto
-
Limitaciones de entrada de consultas: actualmente no se admiten entradas que contengan texto e imagen. Puede utilizar consultas de texto o imágenes, pero no ambas a la vez.
-
Filtros de contenido de imagen de barrera: cuando utiliza consultas de imágenes con una barrera que tiene configurados filtros de contenido de imagen, la imagen de entrada se evalúa comparándola con la de protección. La imagen puede bloquearse si infringe los umbrales de filtro configurados.
-
La entrada y el tipo no coinciden: de forma predeterminada, se asume que la entrada es texto cuando no se especifica el tipo. Cuando utilice modalidades distintas del texto, debe especificar el tipo correcto
Errores y soluciones comunes
Si tiene problemas con su base de conocimientos multimodal, revise estos escenarios comunes:
- Error 4xx al usar consultas de imágenes
-
Causa: intento de usar consultas de imágenes con bases de conocimiento o modelos de incrustación de solo texto. BDA-processed
Solución: elija Amazon Nova Multimodal Embeddings al crear su base de conocimientos para dar soporte a las consultas de imágenes.
- RAG devuelve un error 4xx con contenido multimodal
-
Causa: se usa
RetrieveAndGeneratecon una base de conocimientos que contiene solo contenido multimodal y el modelo de incrustaciones multimodales de Amazon Nova.Solución: utilice el analizador BDA para la funcionalidad RAG o asegúrese de que su base de conocimientos contenga contenido de texto.
- Error requerido para el destino de almacenamiento multimodal
-
Causa: uso de Nova Multimodal Embeddings sin configurar un destino de almacenamiento multimodal.
Solución: especifique un destino de almacenamiento multimodal cuando utilice Nova Multimodal Embeddings.
- La fuente de datos y el almacenamiento multimodal utilizan el mismo depósito de S3
-
Causa: configurar la fuente de datos y el destino de almacenamiento multimodal para usar el mismo bucket de Amazon S3 sin los prefijos de inclusión adecuados.
Solución: utilice depósitos independientes para la fuente de datos y el almacenamiento multimodal, o configure los prefijos de inclusión para evitar volver a ingerir los archivos multimedia extraídos.
- El prefijo de inclusión no puede empezar por «aws/»
-
Causa: se usa un prefijo de inclusión que comience por «aws/» cuando la fuente de datos y el destino de almacenamiento multimodal comparten el mismo bucket de Amazon S3.
Solución: especifique un prefijo de inclusión diferente. La ruta «aws/» está reservada para el almacenamiento multimedia extraído y no se puede usar como prefijo de inclusión para evitar volver a ingerir el contenido procesado.
- La ingesta de BDA omite el contenido multimodal
-
Causa: la base de conocimientos se creó sin un destino de almacenamiento multimodal y, a continuación, se agregó la fuente de datos de BDA con contenido multimodal.
Solución: Re-create la base de conocimientos con un destino de almacenamiento multimodal configurado para permitir el procesamiento BDA de archivos de audio, vídeo e imagen.
- Base de conocimientos creada sin un modelo de integración multimodal
-
Causa: la base de conocimientos se creó con un modelo de incrustación de solo texto, lo que limita las capacidades multimodales.
Solución: cree una nueva base de conocimientos con Nova Multimodal Embeddings para permitir el procesamiento multimodal nativo y las consultas basadas en imágenes.
Administración de datos transitorios con las políticas de ciclo de vida de Amazon S3
Al utilizar Nova Multimodal Embeddings, Amazon Bedrock almacena los datos transitorios en su destino de almacenamiento multimodal e intenta eliminarlos una vez finalizado el procesamiento. Recomendamos aplicar una política de ciclo de vida en la ruta de datos transitoria para garantizar que haya caducado correctamente.
Para obtener más información sobre las políticas del ciclo de vida de Amazon S3, consulte Administración del ciclo de vida de los objetos en la Guía del usuario de Amazon S3.
Consideraciones sobre el rendimiento
Para obtener un rendimiento óptimo con su base de conocimientos multimodal, tenga en cuenta los siguientes factores:
-
Tiempo de procesamiento: el procesamiento de BDA lleva más tiempo debido a la conversión de contenido
-
Latencia de consulta: las consultas de imágenes pueden tener una latencia más alta que las consultas de texto
-
Duración de la fragmentación: las duraciones más largas audio/video de los fragmentos aumentan el tiempo de procesamiento, pero pueden mejorar la precisión