Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Menyesuaikan penyerapan untuk sumber data
Anda dapat menyesuaikan penyerapan vektor saat menghubungkan sumber data di Konsol Manajemen AWS atau dengan memodifikasi nilai vectorIngestionConfiguration bidang saat mengirim CreateDataSource permintaan.
Pilih topik untuk mempelajari cara menyertakan konfigurasi untuk menyesuaikan penyerapan saat menghubungkan ke sumber data:
Pilih strategi penguraian
Basis pengetahuan terkelola mendukung dua strategi penguraian:
-
SMART_PARSING(default) — Strategi penguraian yang dikelola layanan yang secara otomatis memilih pendekatan penguraian terbaik untuk konten Anda. Anda tidak perlu mengkonfigurasi model penguraian atau memberikan pengaturan tambahan. -
MULTI_MODAL_EMBEDDINGS— Mengirim file Anda langsung ke model penyematan multimodal asli alih-alih menguraikannya menjadi teks. Gunakan strategi ini hanya jika basis pengetahuan Anda menggunakan model penyematan multimodal asli, dalam hal ini itu adalah satu-satunya strategi yang didukung. Untuk informasi selengkapnya, lihat Pemrosesan multimodal asli.
Untuk menggunakan penguraian cerdas, Anda dapat menghilangkan parsingConfiguration bidang darivectorIngestionConfiguration, atau secara eksplisit menentukannya sebagai berikut:
{ "parsingConfiguration": { "parsingStrategy": "SMART_PARSING" } }
catatan
Strategi penguraian lainnya, seperti BEDROCK_FOUNDATION_MODEL danBEDROCK_DATA_AUTOMATION, tidak didukung untuk basis pengetahuan terkelola.
Pilih strategi chunking
Anda dapat menyesuaikan bagaimana dokumen dalam data Anda dipotong-potong untuk penyimpanan dan pengambilan. Untuk mempelajari opsi untuk memotong data di Basis Pengetahuan Amazon Bedrock, lihat. Bagaimana content chunking bekerja untuk basis pengetahuan
catatan
Strategi chunking berlaku untuk teks. Jika basis pengetahuan Anda menggunakan model penyematan multimodal asli, file dikirim langsung ke model penyematan alih-alih diurai menjadi teks, sehingga strategi pemotongan ini tidak berlaku. Anda mengontrol bagaimana file audio dan video dibagi menjadi segmen sebagai gantinya. Untuk informasi selengkapnya, lihat Pemrosesan multimodal asli.
Awas
Anda tidak dapat mengubah strategi chunking setelah terhubung ke sumber data.
Di dalamnya Konsol Manajemen AWS Anda memilih strategi chunking saat menghubungkan ke sumber data. Dengan Amazon Bedrock API, Anda menyertakan ChunkingConfiguration di chunkingConfiguration bidang. VectorIngestionConfiguration
Jika Anda menghilangkan konfigurasi ini atau menentukan strategi chunking default, layanan menggunakan chunking ukuran tetap dengan 300 token dan 20% tumpang tindih.
{ "chunkingConfiguration": { "chunkingStrategy": "DEFAULT" } }
Perluas bagian yang sesuai dengan strategi chunking yang ingin Anda gunakan:
Untuk memperlakukan setiap dokumen dalam sumber data Anda sebagai potongan sumber tunggal, tentukan NONE di chunkingStrategy bidangChunkingConfiguration, seperti dalam format berikut:
{ "chunkingStrategy": "NONE" }
Untuk membagi setiap dokumen dalam sumber data Anda menjadi potongan-potongan dengan ukuran yang kira-kira sama, tentukan FIXED_SIZE di chunkingStrategy bidang ChunkingConfiguration dan sertakan a FixedSizeChunkingConfiguration di fixedSizeChunkingConfiguration bidang, seperti dalam format berikut:
{ "chunkingStrategy": "FIXED_SIZE", "fixedSizeChunkingConfiguration": { "maxTokens": number, "overlapPercentage": number } }
catatan
Pemotongan semantik tidak didukung untuk basis pengetahuan terkelola.