View a markdown version of this page

Memecahkan masalah basis pengetahuan multimodal - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Memecahkan masalah basis pengetahuan multimodal

Bagian ini memberikan panduan untuk menyelesaikan masalah umum yang dihadapi saat bekerja dengan basis pengetahuan multimodal. Informasi pemecahan masalah diatur berdasarkan batasan umum, skenario kesalahan umum dengan penyebab dan solusinya, dan rekomendasi pengoptimalan kinerja. Gunakan informasi ini untuk mendiagnosis dan menyelesaikan masalah selama penyiapan, penyerapan, atau kueri konten multimodal Anda.

Batasan umum

Waspadai keterbatasan saat ini saat bekerja dengan basis pengetahuan multimodal:

  • Batas ukuran file: Maksimum 1,5 GB per file video, 1 GB per file audio (Nova Multimodal Embeddings), atau 1,5 GB per file (BDA)

  • File per pekerjaan penyerapan: Maksimum 15.000 file per pekerjaan (Nova Multimodal Embeddings) atau 1.000 file per pekerjaan (BDA)

  • Batas kueri: Maksimal satu gambar per kueri

  • Pembatasan sumber data: Hanya Amazon S3 dan sumber data khusus yang mendukung konten multimodal

  • Batasan chunking BDA: Saat menggunakan Bedrock Data Automation dengan chunking ukuran tetap, pengaturan persentase tumpang tindih tidak diterapkan pada konten audio dan video

  • Batas pekerjaan bersamaan BDA: Batas default 20 pekerjaan BDA bersamaan. Untuk pemrosesan skala besar, pertimbangkan untuk meminta peningkatan kuota layanan

  • Batasan model Reranker: Model Reranker tidak didukung untuk konten multimodal

  • Batasan ringkasan: Ring kasan tanggapan pengambilan yang berisi konten non-teks tidak didukung

  • Batasan input kueri: Input yang berisi teks dan gambar saat ini tidak didukung. Anda dapat menggunakan kueri teks atau gambar, tetapi tidak keduanya secara bersamaan.

  • Filter konten gambar pagar pembatas: Saat Anda menggunakan kueri gambar dengan pagar pembatas yang memiliki filter konten gambar yang dikonfigurasi, gambar input dievaluasi terhadap pagar pembatas. Gambar mungkin diblokir jika melanggar ambang batas filter yang dikonfigurasi.

  • Input dan jenis ketidakcocokan: Secara default, input diasumsikan sebagai teks ketika jenisnya tidak ditentukan. Saat menggunakan modalitas selain teks, Anda harus menentukan jenis yang benar

Kesalahan umum dan solusi

Jika Anda mengalami masalah dengan basis pengetahuan multimodal Anda, tinjau skenario umum berikut:

Kesalahan 4xx saat menggunakan kueri gambar

Penyebab: Men coba menggunakan kueri gambar dengan model penyematan teks saja atau BDA-processed basis pengetahuan.

Solusi: Pilih Amazon Nova Multimodal Embeddings saat membuat basis pengetahuan Anda untuk dukungan kueri gambar.

RAG mengembalikan kesalahan 4xx dengan konten multimodal

Penyebab: Menggunakan RetrieveAndGenerate dengan basis pengetahuan yang hanya berisi konten multimodal dan model Amazon Nova Multimodal Embeddings.

Solusi: Gunakan parser BDA untuk fungsionalitas RAG, atau pastikan bahwa basis pengetahuan Anda berisi konten teks.

Kesalahan tujuan penyimpanan multimodal diperlukan

Penyebab: Menggunakan Nova Multimodal Embeddings tanpa mengonfigurasi tujuan penyimpanan multimodal.

Solusi: T entukan tujuan penyimpanan multimodal saat menggunakan Nova Multimodal Embeddings.

Sumber data dan penyimpanan multimodal menggunakan bucket S3 yang sama

Penyebab: Meng konfigurasi sumber data dan tujuan penyimpanan multimodal untuk menggunakan bucket Amazon S3 yang sama tanpa awalan inklusi yang tepat.

Solusi: Gunakan bucket terpisah untuk sumber data dan penyimpanan multimodal, atau konfigurasikan awalan inklusi untuk mencegah pengambilan kembali file media yang diekstraksi.

Awalan inklusi tidak dapat dimulai dengan “aws/”

Penyebab: Menggunakan awalan inklusi yang dimulai dengan “aws/” saat sumber data dan tujuan penyimpanan multimodal Anda berbagi bucket Amazon S3 yang sama.

Solusi: T entukan awalan inklusi yang berbeda. Jalur “aws/” dicadangkan untuk penyimpanan media yang diekstraksi dan tidak dapat digunakan sebagai awalan inklusi untuk menghindari konsumsi ulang konten yang diproses.

Konsumsi BDA melewatkan konten multimodal

Penyebab: Basis pengetahuan dibuat tanpa tujuan penyimpanan multimodal, kemudian sumber data BDA ditambahkan dengan konten multimodal.

Solusi: Re-create basis pengetahuan dengan tujuan penyimpanan multimodal yang dikonfigurasi untuk memungkinkan pemrosesan BDA file audio, video, dan gambar.

Basis pengetahuan dibuat tanpa model penyematan multimodal

Penyebab: Basis pengetahuan dibuat dengan model penyematan teks saja, membatasi kemampuan multimodal.

Solusi: Buat basis pengetahuan baru dengan Nova Multimodal Embeddings untuk mengaktifkan pemrosesan multimodal asli dan kueri berbasis gambar.

Mengelola data transien dengan kebijakan siklus hidup Amazon S3

Saat menggunakan Nova Multimodal Embeddings, Amazon Bedrock menyimpan data sementara di tujuan penyimpanan multimodal Anda dan mencoba menghapusnya setelah pemrosesan selesai. Sebaiknya terapkan kebijakan siklus hidup pada jalur data sementara untuk memastikan bahwa kebijakan tersebut telah kedaluwarsa dengan benar.

Console
Untuk membuat aturan siklus hidup menggunakan konsol
  1. Buka konsol Amazon S3.

  2. Arahkan ke tujuan penyimpanan multimodal yang telah Anda konfigurasikan untuk Pangkalan Pengetahuan Anda.

  3. Pilih tab Manajemen dan pilih Buat aturan siklus hidup.

  4. Untuk nama aturan siklus hidup, masukkanTransient Data Deletion.

  5. Di bawah Jenis filter, pilih Batasi cakupan aturan ini menggunakan satu atau lebih filter.

  6. Untuk A walan, masukkan jalur data transien untuk basis pengetahuan dan sumber data Anda.

    Ganti nilai placeholder dalam awalan berikut dengan pengidentifikasi aktual Anda:

    aws/bedrock/knowledge_bases/knowledge-base-id/data-source-id/transient_data
    penting

    Jangan menerapkan kebijakan siklus hidup ke seluruh bucket atau awalan “aws/”, karena ini akan menghapus konten multimodal Anda dan menyebabkan kegagalan pengambilan. Hanya gunakan jalur data transien spesifik yang ditunjukkan di atas.

  7. Di bawah Tindakan aturan siklus hidup, pilih Kedaluwarsa versi objek saat ini.

  8. Untuk Hari setelah pembuatan objek, masukkan1.

  9. Pilih Buat aturan.

AWS CLI
Untuk membuat aturan siklus hidup menggunakan AWS CLI
  1. Buat file JSON bernama lifecycle-policy.json dengan konten berikut.

    Ganti nilai placeholder dengan pengidentifikasi aktual Anda:

    • knowledge-base-id- Pengidentifikasi basis pengetahuan Anda

    • data-source-id- Pengidentifikasi sumber data Anda

    { "Rules": [ { "ID": "TransientDataDeletion", "Status": "Enabled", "Filter": { "Prefix": "aws/bedrock/knowledge_bases/knowledge-base-id/data-source-id/transient_data" }, "Expiration": { "Days": 1 } } ] }
  2. Terapkan kebijakan siklus hidup ke bucket Anda. Ganti your-multimodal-storage-bucket dengan nama bucket Anda yang sebenarnya:

    aws s3api put-bucket-lifecycle-configuration \ --bucket your-multimodal-storage-bucket \ --lifecycle-configuration file://lifecycle-policy.json
  3. Verifikasi kebijakan siklus hidup telah diterapkan:

    aws s3api get-bucket-lifecycle-configuration \ --bucket your-multimodal-storage-bucket

Untuk informasi selengkapnya tentang kebijakan siklus hidup Amazon S3, lihat M engelola siklus hidup objek di Panduan Pengguna Amazon S3.

Pertimbangan performa

Untuk kinerja optimal dengan basis pengetahuan multimodal Anda, pertimbangkan faktor-faktor berikut:

  • Waktu pemrosesan: Pem rosesan BDA membutuhkan waktu lebih lama karena konversi konten

  • Latensi kueri: Kueri gambar mungkin memiliki latensi yang lebih tinggi daripada kueri teks

  • Durasi pemotongan: Durasi potongan audio/video yang lebih lama meningkatkan waktu pemrosesan tetapi dapat meningkatkan akurasi