Amazon Redshift tidak akan lagi mendukung penggunaan Python UDF setelah 30 Juni 2026. Kami akan mulai menegakkannya secara bertahap. Untuk informasi lebih lanjut tentang detail opsi akhir masa pakai dan migrasi Python, lihat posting blog
Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Integrasi Amazon Redshift untuk Apache Spark
Apache Spark
Integrasi ini memberi Anda konektor Spark yang dapat Anda gunakan untuk membangun aplikasi Apache Spark yang membaca dari dan menulis ke data di Amazon Redshift dan Amazon Redshift Serverless. Aplikasi ini tidak berkompromi pada kinerja aplikasi atau konsistensi transaksional data. Integrasi ini secara otomatis disertakan dalam Amazon EMR dan AWS Glue, sehingga Anda dapat langsung menjalankan tugas Apache Spark yang mengakses dan memuat data ke Amazon Redshift sebagai bagian dari saluran penyerapan dan transformasi data Anda.
Saat ini, Anda dapat menggunakan versi 3.3.x, 3.4.x, 3.5.x, 4.0.x, dan 4.1.x dari Spark dengan integrasi ini.
Integrasi ini menyediakan yang berikut:
-
AWS Identity and Access Management (IAM) otentikasi. Untuk informasi selengkapnya, lihat Identitas dan manajemen akses di Amazon Redshift.
-
Predikat dan permintaan pushdown untuk meningkatkan kinerja.
-
Jenis data Amazon Redshift.
-
Konektivitas ke Amazon Redshift dan Amazon Redshift Serverless.
Pertimbangan dan batasan saat menggunakan konektor Spark
-
URI tempdir menunjuk ke lokasi Amazon S3. Direktori temp ini tidak dibersihkan secara otomatis dan dapat menambah biaya tambahan. Sebaiknya gunakan kebijakan siklus hidup Amazon S3 di Panduan Pengguna Layanan Penyimpanan Sederhana Amazon untuk menentukan aturan retensi untuk bucket Amazon S3.
-
Secara default, salinan antara Amazon S3 dan Redshift tidak berfungsi jika bucket S3 dan cluster Redshift berada di Wilayah yang berbeda AWS . Untuk menggunakan AWS Regions terpisah, atur
tempdir_regionparameter ke Region dari bucket S3 yang digunakan untuktempdir. -
Cross-Region menulis antara S3 dan Redshift jika menulis data Parquet menggunakan
tempformatparameter. -
Sebaiknya gunakan enkripsi sisi server Amazon S3 untuk mengenkripsi bucket Amazon S3 yang digunakan.
-
Sebaiknya blokir akses publik ke bucket Amazon S3.
-
Kami menyarankan agar cluster Amazon Redshift tidak dapat diakses publik.
-
Sebaiknya aktifkan pencatatan audit Amazon Redshift.
-
Sebaiknya aktifkan enkripsi Amazon Redshift at-rest.
-
Sebaiknya aktifkan SSL untuk koneksi JDBC dari Spark di Amazon EMR ke Amazon Redshift.
-
Sebaiknya berikan peran IAM menggunakan parameter
aws_iam_roleuntuk parameter otentikasi Amazon Redshift.