View a markdown version of this page

Pilih gaya distribusi terbaik - Amazon Redshift

Amazon Redshift tidak akan lagi mendukung penggunaan Python UDF setelah 30 Juni 2026. Kami akan mulai menegakkannya secara bertahap. Untuk informasi lebih lanjut tentang detail opsi akhir masa pakai dan migrasi Python, lihat posting blog yang diterbitkan pada 30 Juni 2025.

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Pilih gaya distribusi terbaik

Saat Anda menjalankan kueri, pengoptimal kueri mendistribusikan ulang baris ke node komputasi sesuai kebutuhan untuk melakukan gabungan dan agregasi apa pun. Tujuan dalam memilih gaya distribusi tabel adalah untuk meminimalkan dampak dari langkah redistribusi dengan menemukan data di tempat yang diperlukan sebelum query dijalankan.

catatan

Saat Anda menggunakan pengoptimalan tabel otomatis, Anda tidak perlu memilih gaya distribusi tabel Anda. Untuk informasi selengkapnya, lihat Pengoptimalan tabel otomatis.

Beberapa saran untuk pendekatan terbaik berikut:

  1. Bagikan tabel fakta dan satu tabel dimensi pada kolom umum mereka.

    Tabel fakta Anda hanya dapat memiliki satu kunci distribusi. Setiap tabel yang bergabung pada kunci lain tidak dikolokasikan dengan tabel fakta. Pilih satu dimensi untuk dikolokasikan berdasarkan seberapa sering digabungkan dan ukuran baris penggabungan. Tentukan kunci utama tabel dimensi dan kunci asing yang sesuai tabel fakta sebagai DISTKEY.

  2. Pilih dimensi terbesar berdasarkan ukuran dataset yang difilter.

    Hanya baris yang digunakan dalam gabungan yang harus didistribusikan, jadi pertimbangkan ukuran dataset setelah pemfilteran, bukan ukuran tabel.

  3. Pilih kolom dengan kardinalitas tinggi dalam kumpulan hasil yang difilter.

    Jika Anda mendistribusikan tabel penjualan pada kolom tanggal, misalnya, Anda mungkin harus mendapatkan distribusi data yang cukup merata, kecuali sebagian besar penjualan Anda bersifat musiman. Namun, jika Anda biasanya menggunakan predikat terbatas rentang untuk memfilter periode tanggal yang sempit, sebagian besar baris yang difilter terjadi pada kumpulan irisan terbatas dan beban kerja kueri miring.

  4. Ubah beberapa tabel dimensi untuk menggunakan distribusi SEMUA.

    Jika tabel dimensi tidak dapat dikolokasikan dengan tabel fakta atau tabel penggabungan penting lainnya, Anda dapat meningkatkan kinerja kueri secara signifikan dengan mendistribusikan seluruh tabel ke semua node. Menggunakan distribusi ALL melipatgandakan kebutuhan ruang penyimpanan dan meningkatkan waktu pemuatan dan operasi pemeliharaan, jadi Anda harus mempertimbangkan semua faktor sebelum memilih distribusi SEMUA.

Agar Amazon Redshift memilih gaya distribusi yang sesuai, tent AUTO ukan gaya distribusi.

Untuk informasi selengkapnya tentang memilih gaya distribusi, lihatDistribusi data untuk optimasi kueri.