View a markdown version of this page

Prasyarat untuk menggunakan penyimpanan vektor yang Anda buat untuk basis pengetahuan - Amazon Bedrock

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Prasyarat untuk menggunakan penyimpanan vektor yang Anda buat untuk basis pengetahuan

Untuk menyimpan penyematan vektor yang dikonversi ke dokumen Anda, Anda menggunakan penyimpanan vektor. Amazon Bedrock Knowledge Bases mendukung alur pembuatan cepat untuk beberapa toko vektor, jadi jika Anda lebih suka Amazon Bedrock membuat indeks vektor secara otomatis untuk Anda di salah satu toko vektor tersebut, lewati prasyarat ini dan lanjutkan ke. Buat basis pengetahuan dengan menghubungkan ke sumber data di Amazon Bedrock Knowledge Bases

Jika Anda ingin menyimpan penyematan vektor biner alih-alih penyematan vektor floating-point (float32) standar, maka Anda harus menggunakan penyimpanan vektor yang mendukung vektor biner.

catatan

Cluster Amazon OpenSearch Serverless dan Amazon Man OpenSearch aged adalah satu-satunya penyimpanan vektor yang mendukung penyimpanan vektor biner.

Anda dapat mengatur penyimpanan vektor Anda sendiri yang didukung untuk mengindeks representasi penyematan vektor data Anda. Anda membuat bidang untuk data berikut:

  • Bidang untuk vektor yang dihasilkan dari teks di sumber data Anda oleh model embeddings yang Anda pilih.

  • Bidang untuk potongan teks yang diekstrak dari file di sumber data Anda.

  • Bidang untuk metadata file sumber yang dikelola Amazon Bedrock.

  • (Jika Anda menggunakan database Amazon Aurora dan ingin mengatur pem filteran pada metadata) Bidang untuk metadata yang Anda kaitkan dengan file sumber Anda. Jika Anda berencana untuk mengatur pemfilteran di toko vektor lain, Anda tidak perlu mengatur bidang ini untuk pemfilteran.

Anda dapat mengenkripsi toko vektor pihak ketiga dengan kunci KMS. Untuk informasi selengkapnya, lihat Enkripsi sumber daya basis pengetahuan.

Pilih tab yang sesuai dengan layanan penyimpanan vektor yang akan Anda gunakan untuk membuat indeks vektor Anda.

catatan

Pilihan model embeddings dan dimensi vektor Anda dapat memengaruhi pilihan penyimpanan vektor yang tersedia. Jika Anda tidak dapat menggunakan penyimpanan vektor pilihan Anda, pilih opsi yang kompatibel model embeddings dan dimensi vektor.

Amazon OpenSearch Serverless
  1. Untuk mengonfigurasi izin dan membuat koleksi pencarian vektor di Amazon OpenSearch Serverless di Konsol Manajemen AWS, ikuti langkah 1 dan 2 di Bek erja dengan koleksi pencarian vektor di Panduan Pengembang OpenSearch Layanan Amazon. Perhatikan pertimbangan berikut saat menyiapkan koleksi Anda:

    1. Berikan koleksi nama dan deskripsi pilihan Anda.

    2. Untuk membuat koleksi Anda menjadi pribadi, pilih Buat standar untuk bagian Keamanan. Kemudian, di bagian Peng aturan akses jaringan, pilih VPC sebagai tipe Akses dan pilih titik akhir VPC. Untuk informasi selengkapnya tentang menyiapkan titik akhir VPC untuk koleksi Amazon OpenSearch Serverless, lihat Meng akses Amazon OpenSearch Serverless menggunakan titik akhir antarmuka (AWS PrivateLink) di Panduan Pengembang OpenSearch Layanan Amazon.

  2. Setelah koleksi dibuat, perhatikan Koleksi ARN saat Anda membuat basis pengetahuan.

  3. Di panel navigasi kiri, pilih Koleksi di bawah Tanpa Server. Kemudian pilih koleksi pencarian vektor Anda.

  4. Pilih tab Indeks. Kemudian pilih Buat indeks vektor.

  5. Di bagian Detail indeks vektor, masukkan nama untuk indeks Anda di bidang Nama indeks vektor.

  6. Di bagian bidang vektor, pilih Tambahkan bidang vektor. Amazon Bedrock menyimpan penyematan vektor untuk sumber data Anda di bidang ini. Berikan konfigurasi berikut:

    • Nama bidang vektor — Berikan nama untuk bidang (misalnya,embeddings).

    • Mesin — Mesin vektor yang digunakan untuk pencarian. Pilih faiss.

    • Dim ensi — Jumlah dimensi dalam vektor. Lihat tabel berikut untuk menentukan berapa banyak dimensi yang harus berisi vektor:

      Model Dimensi
      TitanPenyematan G1 - Teks 1٬536
      TitanPenyematan V2 - Teks 1.024, 512, dan 256
      CohereEmbedBahasa Inggris 1٬024
      CohereEmbedMultibahasa 1٬024
    • Metrik jarak — Metrik yang digunakan untuk mengukur kesamaan antara vektor. Sebaiknya gunakan Euclidean untuk penyematan vektor floating-point.

  7. Perluas bagian manajemen metadata dan tambahkan dua bidang untuk mengonfigurasi indeks vektor untuk menyimpan metadata tambahan yang dapat diambil basis pengetahuan dengan vektor. Tabel berikut menjelaskan bidang dan nilai yang harus ditentukan untuk setiap bidang:

    Deskripsi bidang Bidang pemetaan Jenis data Dapat disaring
    Amazon Bedrock memotong teks mentah dari data Anda dan menyimpan potongan di bidang ini. Nama pilihan Anda (misalnya,text) String True
    Amazon Bedrock menyimpan metadata yang terkait dengan basis pengetahuan Anda di bidang ini. Nama pilihan Anda (misalnya,bedrock-metadata) String False
  8. Catat nama yang Anda pilih untuk nama indeks vektor, nama bidang vektor, dan nama bidang pemetaan manajemen metadata saat Anda membuat basis pengetahuan Anda. Lalu pilih Buat.

Setelah indeks vektor dibuat, Anda dapat melanjutkan untuk membuat basis pengetahuan Anda. Tabel berikut merangkum di mana Anda akan memasukkan setiap informasi yang Anda catat.

Bidang Bidang yang sesuai dalam pengaturan basis pengetahuan (Konsol) Bidang yang sesuai dalam pengaturan basis pengetahuan (API) Deskripsi
Koleksi ARN Koleksi ARN KoleksiArn Nama Sumber Daya Amazon (ARN) dari koleksi pencarian vektor.
Nama indeks vektor Nama indeks vektor vektor IndexName Nama indeks vektor.
Nama bidang vektor Bidang vektor Lapangan Vektor Nama bidang tempat menyimpan penyematan vektor untuk sumber data Anda.
Manajemen metadata (bidang pemetaan pertama) Bidang teks Bidang Teks Nama bidang tempat menyimpan teks mentah dari sumber data Anda.
Manajemen metadata (bidang pemetaan kedua) Bedrock-managed bidang metadata MetadataField Nama bidang tempat menyimpan metadata yang dikelola Amazon Bedrock.

Untuk dokumentasi lebih rinci tentang menyiapkan penyimpanan vektor di Amazon OpenSearch Serverless, lihat Bek erja dengan koleksi pencarian vektor di Panduan Pengembang OpenSearch Layanan Amazon.

Amazon OpenSearch Service Managed Clusters
penting
  1. Untuk membuat domain dan indeks vektor di OpenSearch Cluster di Konsol Manajemen AWS, ikuti langkah-langkah yang dijelaskan dalam Membuat dan mengelola domain OpenSearch Layanan di Panduan Pengembang OpenSearch Layanan Amazon.

    Perhatikan pertimbangan berikut saat menyiapkan domain Anda:

    1. Berikan domain nama pilihan Anda.

    2. Kami menyarankan Anda menggunakan opsi Easy create untuk memulai dengan cepat membuat domain Anda.

      catatan

      Opsi ini memberi Anda domain dengan throughput rendah. Jika Anda memiliki beban kerja yang lebih besar yang memerlukan throughput yang lebih tinggi, pilih opsi Buat Standar. Anda dapat menyesuaikan kapasitas nanti sesuai kebutuhan. Dengan opsi ini, Anda dapat mulai dengan kapasitas terendah, yang kemudian dapat dimodifikasi nanti sesuai kebutuhan.

    3. Untuk Jaringan, Anda harus memilih Ak ses publik. OpenSearch domain yang berada di belakang VPC tidak didukung untuk Basis Pengetahuan Anda.

    4. Untuk Versi, jika Anda menggunakan penyematan vektor biner, Basis Pengetahuan Amazon Bedrock memerlukan versi Engine 2.16 atau yang lebih baru. Selain itu, versi 2.13 atau lebih tinggi diperlukan untuk membuat indeks k-nn. Untuk informasi selengkapnya, lihat K-NN Pencarian di panduan pengembang OpenSearch Layanan Amazon.

    5. Kami menyarankan Anda menggunakan Dual-stack mode ini.

    6. Sebaiknya aktifkan kontrol Fine-grained akses untuk melindungi data di domain Anda, dan mengontrol lebih lanjut izin yang memberikan akses peran layanan basis pengetahuan Anda ke OpenSearch domain dan membuat permintaan.

    7. Biarkan semua pengaturan lainnya ke nilai defaultnya dan pilih Buat untuk membuat domain Anda.

  2. Setelah domain dibuat, pilih untuk mencatat Domain ARN dan titik akhir Domain saat Anda membuat basis pengetahuan.

  3. Setelah Anda membuat domain, Anda dapat membuat indeks vektor dengan menjalankan perintah berikut di OpenSearch dasbor atau menggunakan perintah curl. Lihat informasi yang lebih lengkap dalam dokumentasi OpenSearch .

    Saat menjalankan perintah:

    • Berikan nama untuk bidang vektor (misalnya,embeddings).

    • Pastikan bahwa vektor yang digunakan untuk pencarian adalah faiss. nmslib tidak didukung.

    • Untuk jumlah dimensi dalam vektor, lihat tabel berikut untuk menentukan berapa banyak dimensi yang harus berisi vektor:

      catatan

      Model Titan V2 Embeddings - Teks mendukung beberapa dimensi. Bisa juga 256 atau 512.

      Model Dimensi
      TitanPenyematan G1 - Teks 1٬536
      TitanPenyematan V2 - Teks 1.024, 512, dan 256
      CohereEmbedBahasa Inggris 1٬024
      CohereEmbedMultibahasa 1٬024
    • Anda dapat menambahkan dua bidang untuk mengonfigurasi indeks vektor untuk menyimpan metadata tambahan yang dapat diambil basis pengetahuan dengan vektor. Tabel berikut menjelaskan bidang dan nilai yang harus ditentukan untuk masing-masing bidang tersebut.

      Deskripsi bidang Bidang pemetaan
      Amazon Bedrock memotong teks mentah dari data Anda dan menyimpan potongan di bidang ini. Ditentukan sebagai objek, misalnya,AMAZON_BEDROCK_TEXT_CHUNK.
      Amazon Bedrock menyimpan metadata yang terkait dengan basis pengetahuan Anda di bidang ini. Ditentukan sebagai objek, misalnya,AMAZON_BEDROCK_METADATA.
    PUT /<index-name> { "settings": { "index": { "knn": true } }, "mappings": { "properties": { "<vector-name>": { "type": "knn_vector", "dimension": <embedding-dimension>, "data_type": "binary", # Only needed for binary embeddings "space_type": "l2" | "hamming", # Use l2 for float embeddings and hamming for binary embeddings "method": { "name": "hnsw", "engine": "faiss", "parameters": { "ef_construction": 128, "m": 24 } } }, "AMAZON_BEDROCK_METADATA": { "type": "text", "index": "false" }, "AMAZON_BEDROCK_TEXT_CHUNK": { "type": "text", "index": "true" } } } }
    Bidang metadata khusus untuk pemfilteran

    Jika Anda berencana menggunakan pemfilteran metadata dengan bidang metadata khusus, Anda harus menentukan bidang tersebut dengan keyword tipe atau sebagai text tipe dengan keyword subbidang. Contoh:

    "my_custom_field": { "type": "text", "fields": { "keyword": { "type": "keyword" } } }

    Tanpa struktur ini, pemfilteran kueri pada bidang metadata khusus akan gagal dengan kesalahan “Tulis ulang dulu”.

  4. Catat ARN domain dan titik akhir, dan nama yang Anda pilih untuk nama indeks vektor, nama bidang vektor, dan nama bidang pemetaan manajemen metadata saat Anda membuat basis pengetahuan Anda.

Setelah indeks vektor dibuat, Anda dapat melanjutkan untuk membuat basis pengetahuan Anda. Tabel berikut merangkum di mana Anda akan memasukkan setiap informasi yang Anda catat.

Bidang Bidang yang sesuai dalam pengaturan basis pengetahuan (Konsol) Bidang yang sesuai dalam pengaturan basis pengetahuan (API) Deskripsi
Domain ARN Domain ARN DomainArn Nama Sumber Daya Amazon (ARN) dari OpenSearch domain.
Titik akhir domain Titik akhir domain DomainEndpoint Titik akhir untuk terhubung ke OpenSearch domain.
Nama indeks vektor Nama indeks vektor vektor IndexName Nama indeks vektor.
Nama bidang vektor Bidang vektor Lapangan Vektor Nama bidang tempat menyimpan penyematan vektor untuk sumber data Anda.
Manajemen metadata (bidang pemetaan pertama) Bidang teks Bidang Teks Nama bidang tempat menyimpan teks mentah dari sumber data Anda.
Manajemen metadata (bidang pemetaan kedua) Bedrock-managed bidang metadata MetadataField Nama bidang tempat menyimpan metadata yang dikelola Amazon Bedrock.
Amazon S3 Vectors

Amazon S3 Vectors menyediakan penyimpanan vektor hemat biaya di Amazon S3 yang dapat digunakan untuk menyimpan dan menanyakan data vektor. Ini menyediakan penyimpanan yang tahan lama dan elastis dari kumpulan data vektor besar dengan kinerja kueri sub-detik. Amazon S3 Vectors paling cocok untuk beban kerja kueri yang jarang, dan dapat membantu mengurangi biaya saat digunakan dalam pengambilan augmented generation (RAG) dan aplikasi pencarian semantik.

Amazon S3 Vectors memperkenalkan bucket vektor S3, yang berisi indeks vektor yang dapat Anda kueri berdasarkan makna semantik dan kesamaan. Ini dapat digunakan untuk memberikan waktu respons kueri sub-detik dan mengurangi biaya saat menyimpan, mengakses, dan menanyakan data vektor dalam skala tanpa menyediakan infrastruktur apa pun. Di dalam bucket vektor, Anda dapat mengatur data vektor Anda dalam indeks vektor. Bucket vektor Anda dapat memiliki beberapa indeks vektor. Untuk informasi selengkapnya, lihat Amazon S3 Vectors di Panduan Pengguna Amazon S3.

catatan
  • Anda dapat membuat basis pengetahuan untuk Amazon S3 Vectors di Wilayah AWS semua tempat Amazon Bedrock dan Amazon S3 Vectors tersedia. Untuk informasi tentang ketersediaan Amazon S3 Vectors secara regional, lihat Amazon S3 Vectors di Panduan Pengguna Amazon S3.

  • Saat menggunakan jumlah token yang sangat tinggi dengan pemotongan hierarkis di Basis Pengetahuan Amazon Bedrock, Anda dapat melampaui batas ukuran metadata maksimum karena hubungan potongan induk-anak dan konteks hierarkis disimpan sebagai metadata yang tidak dapat disaring di Amazon S3 Vectors. Untuk informasi selengkapnya tentang batas ukuran metadata per vektor, lihat Batasan dan pembatasan di Panduan Pengguna Amazon S3. Untuk informasi tentang strategi chunking, lihatBagaimana content chunking bekerja untuk basis pengetahuan.

Dukungan metadata

Anda dapat melampirkan metadata sebagai pasangan kunci-nilai ke setiap vektor. Secara default, metadata dapat difilter dan dapat digunakan dalam kueri pencarian kesamaan untuk memfilter berdasarkan kondisi seperti tanggal, kategori, atau preferensi pengguna.

Anda juga dapat mengonfigurasi metadata agar tidak dapat disaring saat membuat indeks vektor. Indeks vektor Amazon S3 mendukung jenis string, boolean, dan angka.

Saat menggunakan Amazon S3 Vectors dengan Amazon Bedrock Knowledge Bases, Anda dapat melampirkan hingga 1 KB metadata khusus (termasuk metadata yang dapat disaring dan tidak dapat disaring) dan 35 kunci metadata per vektor. Untuk informasi selengkapnya tentang batas ukuran metadata per vektor, lihat Batasan dan pembatasan di Panduan Pengguna Amazon S3.

Jika metadata melebihi batas ini, tugas penyerapan akan menampilkan pengecualian saat mengisi indeks vektor. Untuk informasi selengkapnya, lihat Amazon S3 Vectors di Panduan Pengguna Amazon S3.

Izin yang diperlukan

Pastikan kebijakan IAM Anda memungkinkan Amazon Bedrock mengakses indeks vektor Anda di bucket vektor S3. Untuk informasi lebih lanjut tentang izin yang diperlukan, lihat Membuat peran layanan untuk Basis Pengetahuan Amazon Bedrock.

Buat bucket dan indeks vektor S3

Untuk menggunakan Amazon S3 Vectors dengan basis pengetahuan Anda, Anda perlu membuat bucket vektor S3 dan indeks vektor. Anda dapat membuat bucket vektor dan indeks menggunakan konsol Amazon S3, AWS CLI, atau AWS SDK. Untuk petunjuk terperinci, lihat Membuat indeks vektor di Panduan Pengguna Amazon S3.

Perhatikan pertimbangan berikut saat membuat bucket vektor dan indeks di konsol Amazon S3.

  1. Saat membuat bucket vektor S3 Anda, perhatikan pertimbangan berikut.

    • Berikan nama bucket Vector yang unik.

    • (Opsional) Amazon S3 akan secara otomatis mengenkripsi data menggunakan en Server-side kripsi default dengan kunci terkelola Amazon S3 (SSE-S3). Anda dapat memilih apakah akan menggunakan enkripsi default ini, atau en Server-side kripsi dengan AWS kunci Layanan Manajemen Kunci (SSE-KMS) sebagai gantinya.

      catatan

      Jenis enkripsi tidak dapat diubah setelah bucket vektor dibuat.

      Untuk petunjuk langkah demi langkah, lihat Enkripsi dengan kunci AWS KMS.

  2. Setelah Anda membuat bucket vektor S3, perhatikan Nama Sumber Daya Amazon (ARN) dari bucket vektor saat Anda membuat basis pengetahuan.

  3. Pilih bucket vektor yang Anda buat dan kemudian buat indeks vektor. Saat membuat indeks vektor, perhatikan pertimbangan berikut.

    • Nama indeks vektor — Menyediakan nama untuk bidang (misalnya,embeddings).

    • Dimensi — Jumlah dimensi dalam vektor. Dimensi harus berupa nilai antara 1 dan 4096. Lihat tabel berikut untuk menentukan berapa banyak dimensi yang harus berisi vektor berdasarkan pilihan model embeddings Anda:

      Model Dimensi
      TitanPenyematan G1 - Teks 1٬536
      TitanPenyematan V2 - Teks 1.024, 512, dan 256
      CohereEmbedBahasa Inggris 1٬024
      CohereEmbedMultibahasa 1٬024
    • catatan

      Amazon S3 Vectors hanya mendukung penyematan floating-point. Penyematan biner tidak didukung.

      Metrik jarak — Metrik yang digunakan untuk mengukur kesamaan antara vektor. Anda dapat menggunakan Cosine atau E uclidean.

  4. Perluas pengaturan Tambahan dan berikan metadata yang tidak dapat disaring di bidang Non-filterable metadata.

    Anda dapat mengonfigurasi maksimal 10 kunci metadata yang tidak dapat disaring. Pilih Tambah kunci dan kemudian tambahkan AMAZON_BEDROCK_TEXT dan AMAZON_BEDROCK_METADATA sebagai kunci.

  5. Di bawah Enkripsi, pilih Tentukan jenis enkripsi. Anda memiliki opsi untuk Menggunakan pengaturan bucket untuk enkripsi atau mengganti pengaturan enkripsi untuk indeks vektor. Jika Anda mengganti setelan tingkat bucket, Anda memiliki opsi untuk menentukan jenis enkripsi untuk indeks vektor sebagai en Server-side kripsi dengan AWS kunci Layanan Manajemen Kunci (SSE-KMS) atau en Server-side kripsi default dengan kunci terkelola Amazon S3 (). SSE-S3 Untuk informasi selengkapnya tentang menyetel konfigurasi enkripsi untuk indeks vektor, lihat Per lindungan data dan enkripsi di Amazon S3 Vectors.

  6. Di bawah Tag (Opsional), Anda dapat menambahkan tag sebagai pasangan kunci-nilai untuk membantu melacak dan mengatur biaya indeks vektor menggunakan Pen AWS agihan dan Manajemen Biaya. Masukkan Kunci dan Nilai. Untuk menambahkan tag lainnya, pilih Tambahkan tag. Anda dapat memasukkan hingga 50 tag untuk indeks vektor. Untuk informasi selengkapnya, lihat Menggunakan tag dengan indeks vektor Amazon S3.

  7. Buat indeks vektor dan catat Nama Sumber Daya Amazon (ARN) dari indeks vektor saat Anda membuat basis pengetahuan.

Buat basis pengetahuan untuk bucket vektor S3

Setelah Anda mengumpulkan informasi ini, Anda dapat melanjutkan untuk membuat basis pengetahuan Anda. Saat membuat basis pengetahuan Anda dengan bucket vektor S3, Anda harus menyediakan ARN dari bucket vektor dan indeks vektor. Indeks vektor akan menyimpan embeddings yang dihasilkan dari sumber data Anda. Tabel berikut merangkum di mana Anda akan memasukkan setiap informasi:

Bidang Bidang yang sesuai dalam pengaturan basis pengetahuan (Konsol) Bidang yang sesuai dalam pengaturan basis pengetahuan (API) Deskripsi
Vektor ember ARN S3 vektor ember ARN vektor BucketArn Nama Sumber Daya Amazon (ARN) dari bucket vektor S3 Anda.
Vektor indeks ARN S3 vektor indeks ARN VektorIndeksArn Nama Sumber Daya Amazon (ARN) dari indeks vektor untuk bucket vektor S3 Anda.
Amazon Aurora (RDS)
  1. Buat cluster, skema, dan tabel database Amazon Aurora (DB) dengan mengikuti langkah-langkah di Menggunakan Aurora PostgreSQL sebagai basis pengetahuan. Saat Anda membuat tabel, konfigurasikan dengan kolom dan tipe data berikut. Anda dapat menggunakan nama kolom yang Anda sukai alih-alih yang tercantum dalam tabel berikut. Catat nama kolom yang Anda pilih sehingga Anda dapat menyediakannya selama pengaturan basis pengetahuan.

    Anda harus menyediakan bidang-bidang ini sebelum membuat basis pengetahuan. Mereka tidak dapat diperbarui setelah basis pengetahuan dibuat.

    penting

    Cluster Aurora harus berada di tempat yang Akun AWS sama dengan tempat basis pengetahuan dibuat untuk Amazon Bedrock.

    Nama kolom Jenis data Bidang yang sesuai dalam pengaturan basis pengetahuan (Konsol) Bidang yang sesuai dalam pengaturan basis pengetahuan (API) Deskripsi
    id Kunci utama UUID Kunci primer primaryKeyField Berisi pengidentifikasi unik untuk setiap catatan.
    menyematkan Vektor Bidang vektor vectorField Berisi penyematan vektor dari sumber data.
    potongan-potongan Teks Bidang teks textField Berisi potongan teks mentah dari sumber data Anda.
    Metadata JSON Bedrock-managed bidang metadata metadataField Berisi metadata yang diperlukan untuk melakukan atribusi sumber dan untuk mengaktifkan penyerapan data dan kueri
    kustom_metadata JSONB Bidang metadata kustom customMetadataField Bidang opsional yang menunjukkan kolom tempat Amazon Bedrock akan menulis semua informasi dari file metadata apa pun dari sumber data Anda.
  2. Anda harus membuat indeks pada vektor kolom dan teks untuk bidang teks dan penyematan Anda. Jika Anda menggunakan bidang metadata khusus, Anda juga harus membuat indeks GIN pada kolom ini. Indeks GIN dapat digunakan untuk secara efisien mencari pasangan kunci-nilai dalam dokumen jsonb untuk pemfilteran metadata. Untuk informasi selengkapnya, lihat pengindeksan jsonb dalam dokumentasi PostgreSQL.

    Nama kolom Buat indeks pada Diperlukan?
    menyematkan CREATE INDEX ON bedrock_integration.bedrock_kb USING hnsw (embedding vector_cosine_ops); Ya
    potongan-potongan CREATE INDEX ON bedrock_integration.bedrock_kb USING gin (to_tsvector('simple', chunks)); Ya
    metadata kustom CREATE INDEX ON bedrock_integration.bedrock_kb USING gin (custom_metadata); Hanya jika Anda telah membuat kolom metadata khusus.
    catatan

    Untuk meningkatkan akurasi dan latensi pencarian hibrida dengan konten bahasa Inggris, pertimbangkan untuk menggunakan kamus 'bahasa Inggris' alih-alih 'sederhana':

    CREATE INDEX ON bedrock_integration.bedrock_kb USING gin (to_tsvector('english', chunks));
    catatan

    Jika Anda menggunakan pemfilteran metadata dengan basis pengetahuan Anda, sebaiknya aktifkan pemindaian indeks iteratif HNSW (memerlukan pgvector 0.8.0 atau yang lebih baru). Tanpa pemindaian berulang, filter metadata selektif dapat mengembalikan hasil yang lebih sedikit dari yang diharapkan karena pemfilteran diterapkan setelah pemindaian indeks HNSW. Pemindaian berulang secara otomatis memindai lebih banyak indeks sampai hasil filter yang cukup ditemukan.

    ALTER DATABASE your_database SET hnsw.iterative_scan = 'relaxed_order'; ALTER DATABASE your_database SET hnsw.max_scan_tuples = 20000;

    Pengaturan ini tetap ada di tingkat database tetapi hanya berlaku untuk sesi baru. Jika Anda menggunakan API Data RDS, tunggu beberapa menit untuk sesi kumpulan koneksi didaur ulang sebelum pengaturan berlaku.

  3. (Opsional) Jika Anda menambahkan metadata ke file untuk difilter, sebaiknya berikan nama kolom di bidang metadata khusus untuk menyimpan semua metadata Anda dalam satu kolom. Selama penyerapan data, kolom ini akan diisi dengan semua informasi dalam file metadata dari sumber data Anda. Jika Anda memilih untuk memberikan bidang ini, Anda harus membuat indeks GIN pada kolom ini.

    catatan

    Jika Anda sering menggunakan filter rentang di atas metadata numerik, maka untuk mengoptimalkan kinerja, buat indeks untuk kunci tertentu. Misalnya, jika Anda menggunakan filter seperti"lessThan": { "key": "year", "value": 1989 }, buat indeks ekspresi pada year kunci. Untuk informasi selengkapnya, lihat Indeks pada ekspresi dalam dokumentasi PostgreSQL.

    CREATE INDEX ON your_table ((custom_metadata->>'year')::double precision

    Atau, jika Anda tidak memberikan nama bidang ini, Anda dapat membuat kolom untuk setiap atribut metadata dalam file Anda dan menentukan jenis data (teks, angka, atau boolean). Misalnya, jika atribut genre ada di sumber data Anda, Anda akan menambahkan kolom bernama genre dan tentukan text sebagai tipe data. Selama penyerapan data, kolom terpisah ini akan diisi dengan nilai atribut yang sesuai.

  4. Konfigurasikan AWS Secrets Manager rahasia untuk cluster Aurora DB Anda dengan mengikuti langkah-langkah di Manajemen kata sandi dengan Amazon Aurora dan AWS Secrets Manager.

  5. Catat informasi berikut setelah Anda membuat cluster DB Anda dan mengatur rahasia.

    Bidang dalam pengaturan basis pengetahuan (Konsol) Bidang dalam pengaturan basis pengetahuan (API) Deskripsi
    Amazon Aurora DB Cluster ARN Sumber dayaBelajar ARN cluster DB Anda.
    Nama database databaseName Nama database Anda
    Nama tabel tableName Nama tabel di cluster DB Anda
    Rahasia ARN kredensibilitas SecretArn ARN AWS Secrets Manager kunci untuk cluster DB Anda
Neptune Analytics graphs (GraphRAG)
  1. Untuk membuat grafik dan penyimpanan vektor di Neptune Analytics di Konsol Manajemen AWS, ikuti langkah-langkah yang dijelaskan dalam Pengindeksan vektor di Neptune Analytics di Panduan Pengguna Neptune Analytics.

    catatan

    Untuk menggunakan Neptune GraphRag, buat grafik Neptune Analytics kosong dengan indeks pencarian vektor. Indeks pencarian vektor hanya dapat dibuat ketika grafik dibuat. Saat Anda membuat grafik Neptune Analytics di konsol, Anda menentukan dimensi indeks di bawah Pengaturan pencarian vektor di dekat akhir proses.

    Perhatikan pertimbangan berikut saat membuat grafik:

    1. Berikan grafik nama pilihan Anda.

    2. Di bawah Sumber data, pilih Buat grafik kosong, dan tentukan jumlah m-NCU yang akan dialokasikan. Setiap m-NCU memiliki sekitar satu GiB kapasitas memori dan komputasi dan jaringan yang sesuai.

      catatan

      Kapasitas grafik Anda dapat dimodifikasi nanti. Kami menyarankan Anda memulai dengan instance terkecil dan kemudian memilih instance yang berbeda, jika diperlukan.

    3. Anda dapat meninggalkan pengaturan konektivitas jaringan default. Amazon Bedrock akan membuat koneksi jaringan ke grafik Neptune Analytics yang Anda kaitkan dengan basis pengetahuan. Anda tidak perlu mengkonfigurasi konektivitas publik atau titik akhir pribadi untuk grafik Anda.

    4. Di bawah Pengaturan pencarian vektor, pilih Gunakan dimensi vektor dan tentukan jumlah dimensi di setiap vektor.

      catatan

      Jumlah dimensi dalam setiap vektor harus sesuai dengan dimensi vektor dalam model embeddings. Lihat tabel berikut untuk menentukan berapa banyak dimensi yang harus berisi vektor:

      Model Dimensi
      TitanPenyematan G1 - Teks 1٬536
      TitanPenyematan V2 - Teks 1.024, 512, dan 256
      CohereEmbedBahasa Inggris 1٬024
      CohereEmbedMultibahasa 1٬024
    5. Biarkan semua pengaturan lainnya ke defaultnya dan buat grafik.

  2. Setelah grafik dibuat, pilih untuk mencatat dimensi Resource ARN dan Vector saat Anda membuat basis pengetahuan. Saat memilih model embeddings di Amazon Bedrock, pastikan Anda memilih model dengan dimensi yang sama dengan dimensi Vektor yang Anda konfigurasikan pada grafik Neptune Analytics.

Setelah indeks vektor dibuat, Anda dapat melanjutkan untuk membuat basis pengetahuan Anda. Tabel berikut merangkum di mana Anda akan memasukkan setiap informasi yang Anda catat.

Bidang Bidang yang sesuai dalam pengaturan basis pengetahuan (Konsol) Bidang yang sesuai dalam pengaturan basis pengetahuan (API) Deskripsi
Grafik ARN Grafik Analitik Neptunus ARN Grapharn Nama Sumber Daya Amazon (ARN) dari grafik Neptune Analytics.
Manajemen metadata (bidang pemetaan pertama) Nama bidang teks Bidang Teks Nama bidang tempat menyimpan teks mentah dari sumber data Anda. Anda dapat memberikan nilai apa pun untuk bidang ini, misalnya, teks.
Manajemen metadata (bidang pemetaan kedua) Bedrock-managed bidang metadata MetadataField Nama bidang tempat menyimpan metadata yang dikelola Amazon Bedrock. Anda dapat memberikan nilai apa pun untuk bidang ini, misalnya, metadata.
Pinecone
catatan

Jika Anda menggunakanPinecone, Anda setuju untuk memberikan otorisasi AWS untuk mengakses sumber pihak ketiga yang ditunjuk atas nama Anda untuk menyediakan layanan toko vektor kepada Anda. Anda bertanggung jawab untuk mematuhi persyaratan pihak ketiga yang berlaku untuk penggunaan dan transfer data dari layanan pihak ketiga.

Untuk dokumentasi terperinci tentang menyiapkan penyimpanan vektor diPinecone, lihat Pinecone sebagai basis pengetahuan untuk Amazon Bedrock.

Saat Anda mengatur penyimpanan vektor, perhatikan informasi berikut, yang akan Anda isi saat membuat basis pengetahuan:

  • Endpoint URL — URL titik akhir untuk halaman manajemen indeks Anda.

  • Rahasia kredensional ARN — Nama Sumber Daya Amazon (ARN) dari rahasia yang Anda buat AWS Secrets Manager yang berisi nama pengguna dan kata sandi untuk pengguna database.

  • (Opsional) Customer-managed Kunci KMS untuk rahasia Kredensi ARN Anda — jika Anda mengenkripsi rahasia kredensia ARN Anda, berikan kunci KMS sehingga Amazon Bedrock dapat mendekripsinya.

  • Ruang Nama — (Opsional) Namespace yang akan digunakan untuk menulis data baru ke database Anda. Untuk informasi selengkapnya, lihat Menggunakan ruang nama.

Ada konfigurasi tambahan yang harus Anda berikan saat membuat Pinecone indeks:

  • Nama bidang teks — Nama bidang tempat Amazon Bedrock harus menyimpan teks potongan mentah.

  • Nama bidang metadata — Nama bidang tempat Amazon Bedrock harus menyimpan metadata atribusi sumber.

Untuk mengakses Pinecone indeks Anda, Anda harus memberikan kunci Pinecone API Anda ke Amazon Bedrock melalui. AWS Secrets Manager

Untuk membuat rahasia untuk Anda Pinecone konfigurasi
  1. Ikuti langkah-langkah di Buat AWS Secrets Manager rahasia, atur kunci sebagai apiKey dan nilainya sebagai kunci API untuk mengakses Pinecone indeks Anda.

  2. Untuk menemukan kunci API Anda, buka konsol Pinecone Anda dan pilih API Keys.

  3. Setelah Anda membuat rahasia, perhatikan ARN kunci KMS.

  4. Lampirkan izin ke peran layanan Anda untuk mendekripsi ARN kunci KMS dengan mengikuti langkah-langkah diIzin untuk mendekripsi AWS Secrets Manager rahasia untuk toko vektor yang berisi basis pengetahuan Anda.

  5. Kemudian, ketika Anda membuat basis pengetahuan Anda, masukkan ARN di bidang Arn rahasia Kre denSIAL.

Awan Perusahaan Redis
catatan

Jika Anda menggunakanRedis Enterprise Cloud, Anda setuju untuk memberikan otorisasi AWS untuk mengakses sumber pihak ketiga yang ditunjuk atas nama Anda untuk menyediakan layanan toko vektor kepada Anda. Anda bertanggung jawab untuk mematuhi persyaratan pihak ketiga yang berlaku untuk penggunaan dan transfer data dari layanan pihak ketiga.

Untuk dokumentasi terperinci tentang menyiapkan penyimpanan vektor diRedis Enterprise Cloud, lihat Meng integrasikan Redis Enterprise Cloud dengan Amazon Bedrock.

Saat Anda mengatur penyimpanan vektor, perhatikan informasi berikut, yang akan Anda isi saat membuat basis pengetahuan:

  • Endpoint URL — URL titik akhir publik untuk database Anda.

  • Nama indeks vektor — Nama indeks vektor untuk database Anda.

  • Bidang vektor — Nama bidang tempat penyematan vektor akan disimpan. Lihat tabel berikut untuk menentukan berapa banyak dimensi yang harus berisi vektor.

    Model Dimensi
    TitanPenyematan G1 - Teks 1٬536
    TitanPenyematan V2 - Teks 1.024, 512, dan 256
    CohereEmbedBahasa Inggris 1٬024
    CohereEmbedMultibahasa 1٬024
  • Bid ang teks — Nama bidang tempat Amazon Bedrock menyimpan potongan teks mentah.

  • Bedrock-managed bidang metadata — Nama bidang tempat Amazon Bedrock menyimpan metadata yang terkait dengan basis pengetahuan Anda.

Untuk mengakses Redis Enterprise Cloud cluster Anda, Anda harus memberikan konfigurasi Redis Enterprise Cloud keamanan Anda ke Amazon Bedrock melalui. AWS Secrets Manager

Untuk membuat rahasia untuk Anda Awan Perusahaan Redis konfigurasi
  1. Aktifkan TLS untuk menggunakan database Anda dengan Amazon Bedrock dengan mengikuti langkah-langkah di Transport Layer Security (TLS).

  2. Ikuti langkah-langkah di Buat AWS Secrets Manager rahasia. Siapkan kunci berikut dengan nilai yang sesuai dari Redis Enterprise Cloud konfigurasi Anda di rahasia:

    • username— Nama pengguna untuk mengakses Redis Enterprise Cloud database Anda. Untuk menemukan nama pengguna Anda, lihat di bawah bagian Keamanan database Anda di Redis Console.

    • password— Kata sandi untuk mengakses Redis Enterprise Cloud database Anda. Untuk menemukan kata sandi Anda, lihat di bawah bagian Keamanan database Anda di Redis Console.

    • serverCertificate— Isi sertifikat dari otoritas Redis Cloud Certificate. Unduh sertifikat server dari Redis Admin Console dengan mengikuti langkah-langkah di Unduh sertifikat.

    • clientPrivateKey— Kunci pribadi sertifikat dari otoritas Redis Cloud Certificate. Unduh sertifikat server dari Redis Admin Console dengan mengikuti langkah-langkah di Unduh sertifikat.

    • clientCertificate— Kunci publik sertifikat dari otoritas Redis Cloud Certificate. Unduh sertifikat server dari Redis Admin Console dengan mengikuti langkah-langkah di Unduh sertifikat.

  3. Setelah Anda membuat rahasia, perhatikan ARN-nya. Kemudian, ketika Anda membuat basis pengetahuan Anda, masukkan ARN di bidang Arn rahasia Kre denSIAL.

MongoDB Atlas
catatan

Jika Anda menggunakan MongoDB Atlas, Anda setuju untuk memberikan otorisasi AWS untuk mengakses sumber pihak ketiga yang ditunjuk atas nama Anda untuk menyediakan layanan toko vektor kepada Anda. Anda bertanggung jawab untuk mematuhi persyaratan pihak ketiga yang berlaku untuk penggunaan dan transfer data dari layanan pihak ketiga.

Untuk dokumentasi terperinci tentang menyiapkan penyimpanan vektor di MongoDB Atlas, lihat Meluncurkan Alur Kerja RAG yang Dikelola Sepenuhnya Dengan MongoDB Atlas dan Amazon Bedrock.

Saat Anda mengatur penyimpanan vektor, perhatikan informasi berikut yang akan Anda tambahkan ketika Anda membuat basis pengetahuan:

  • URL Endpoint — URL titik akhir cluster MongoDB Atlas Anda.

  • Nama database — Nama database di cluster MongoDB Atlas Anda.

  • Nama koleksi — Nama koleksi dalam database Anda.

  • Rahasia kreden sional ARN — Nama Sumber Daya Amazon (ARN) dari rahasia yang Anda buat AWS Secrets Manager yang berisi nama pengguna dan kata sandi untuk pengguna database di cluster MongoDB Atlas Anda. Rahasianya harus berisi kunci bernama username danpassword.

  • (Opsional) Customer-managed Kunci KMS untuk rahasia Kredensi ARN Anda — jika Anda mengenkripsi rahasia kredensia ARN Anda, berikan kunci KMS sehingga Amazon Bedrock dapat mendekripsinya.

Ada konfigurasi tambahan untuk pemetaan Bidang yang harus Anda berikan saat membuat indeks MongoDB Atlas:

  • Nama indeks vektor — Nama Indeks Pencarian Vektor MongoDB Atlas pada koleksi Anda.

  • Nama bidang vektor — Nama bidang tempat Amazon Bedrock harus menyimpan penyematan vektor.

  • Nama bidang teks — Nama bidang tempat Amazon Bedrock harus menyimpan teks potongan mentah.

  • Nama bidang metadata — Nama bidang tempat Amazon Bedrock harus menyimpan metadata atribusi sumber.

  • (Opsional) Nama indeks pencarian teks — Nama indeks Pencarian Atlas MongoDB pada koleksi Anda.

penting

Jika Anda berencana untuk menggunakan pemfilteran metadata dengan basis pengetahuan MongoDB Atlas Anda, Anda harus mengonfigurasi filter secara manual di indeks vektor Anda. Pemfilteran metadata tidak berfungsi secara default dan memerlukan pengaturan tambahan dalam konfigurasi indeks vektor MongoDB Atlas Anda.

(Opsional) Agar Amazon Bedrock terhubung ke cluster MongoDB Atlas Anda AWS PrivateLink, lihat Alu r kerja RAG dengan MongoDB Atlas menggunakan Amazon Bedrock.