Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Mengonfigurasi properti pekerjaan untuk pekerjaan Spark di AWS Glue
Saat menentukan pekerjaan di AWS Glue konsol, Anda memberikan nilai properti untuk mengontrol lingkungan AWS Glue runtime.
Mendefinisikan properti pekerjaan untuk pekerjaan Spark
Daftar berikut menjelaskan properti-properti tugas Spark. Untuk properti dari tugas shell Python, lihat Mendefinisikan properti pekerjaan untuk pekerjaan shell Python. Untuk properti dari tugas ETL streaming, lihat Mendefinisikan properti pekerjaan untuk pekerjaan ETL streaming.
Properti dicantumkan dalam urutan kemunculannya di wizard Tambah pekerjaan di AWS Glue konsol.
- Nama
-
Berikan UTF-8 string dengan panjang maksimum 255 karakter.
- Deskripsi
-
Berikan deskripsi opsional hingga 2048 karakter.
- IAM Role
-
Tentukan IAM role yang digunakan untuk otorisasi ke sumber daya yang digunakan untuk menjalankan tugas dan mengakses penyimpanan data. Untuk informasi selengkapnya tentang izin untuk menjalankan pekerjaan di AWS Glue, lihatManajemen identitas dan akses untuk AWS Glue.
- Tipe
-
Jenis pekerjaan ETL. Ini diatur secara otomatis berdasarkan jenis sumber data yang Anda pilih.
-
Spark menjalankan skrip Apache Spark ETL dengan perintah job
glueetl. -
Spark Streaming menjalankan skrip ETL streaming Apache Spark dengan perintah job
gluestreaming. Untuk informasi selengkapnya, lihat Lowongan kerja Streaming ETL di AWS Glue. -
Python shell menjalankan skrip Python dengan perintah pekerjaan
pythonshell. Untuk informasi selengkapnya, lihat Mengonfigurasi properti pekerjaan untuk pekerjaan shell Python di AWS Glue.
-
- Versi AWS Glue
-
AWS Glue versi menentukan versi Apache Spark dan Python yang tersedia untuk pekerjaan, seperti yang ditentukan dalam tabel berikut.
AWS Glue versi Versi Spark dan Python yang didukung 6.0 -
Percikan 4.1.1
-
Python 3.13
5.1 -
Percikan 3.5.6
-
Python 3.11
5.0 -
Percikan 3.5.4
-
Python 3.11
4.0 -
Percikan 3.3.0
-
Python 3.10
3.0 -
Spark 3.1.1
-
Python 3.7
Pekerjaan yang dibuat tanpa menentukan AWS Glue versi default ke AWS Glue 5.1.
-
- Bahasa
-
Kode dalam skrip ETL mendefinisikan logika tugas Anda. Skrip dapat dikodekan dengan Python atau Scala. Anda dapat memilih apakah skrip yang dijalankan pekerjaan dihasilkan oleh AWS Glue atau disediakan oleh Anda. Anda menyediakan nama skrip dan lokasi di Amazon Simple Storage Service (Amazon S3). Konfirmasi bahwa tidak ada file dengan nama yang sama sebagai direktori skrip pada path. Untuk mem-pelajari selengkapnya tentang menulis skrip, lihat AWS Glue panduan pemrograman.
- Jenis pekerja
-
Jenis-jenis pekerja berikut tersedia:
Sumber daya yang tersedia pada AWS Glue pekerja diukur dalam DPU. DPU adalah ukuran relatif daya pemrosesan yang terdiri dari 4 vCPU kapasitas komputasi dan 16 GB memori.
-
G.025X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 0,25 DPU (2 vCPU, memori 4 GB) dengan disk 84GB (sekitar 34GB gratis). Kami merekomendasikan jenis pekerja ini untuk pekerjaan streaming volume rendah. Jenis pekerja ini hanya tersedia untuk pekerjaan streaming AWS Glue versi 3.0 atau yang lebih baru. -
G.1X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 1 DPU (4 vCPU, memori 16 GB) dengan disk 94GB (sekitar 44GB gratis). Kami merekomendasikan jenis pekerja ini untuk beban kerja seperti transformasi data, gabungan, dan kueri, untuk menawarkan cara yang dapat diskalakan dan hemat biaya untuk menjalankan sebagian besar pekerjaan. -
G.2X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 2 DPU (8 vCPU, memori 32 GB) dengan disk 138GB (sekitar 78GB gratis). Kami merekomendasikan jenis pekerja ini untuk beban kerja seperti transformasi data, gabungan, dan kueri, untuk menawarkan cara yang dapat diskalakan dan hemat biaya untuk menjalankan sebagian besar pekerjaan. -
G.4X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 4 DPU (16 vCPU, 64 GB memori) dengan disk 256GB (sekitar 230GB gratis). Kami merekomendasikan jenis pekerja ini untuk pekerjaan yang beban kerjanya berisi transformasi, agregasi, gabungan, dan kueri yang paling menuntut. -
G.8X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 8 DPU (32 vCPU, memori 128 GB) dengan disk 512GB (sekitar 485GB gratis). Kami merekomendasikan jenis pekerja ini untuk pekerjaan yang beban kerjanya berisi transformasi, agregasi, gabungan, dan kueri yang paling menuntut. -
G.12X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 12 DPU (48 vCPU, 192 GB memori) dengan disk 768 GB (sekitar 741GB gratis). Kami merekomendasikan jenis pekerja ini untuk pekerjaan dengan beban kerja yang sangat besar dan padat sumber daya yang memerlukan kapasitas komputasi yang signifikan. -
G.16X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 16 DPU (64 vCPU, memori 256 GB) dengan disk 1024 GB (sekitar 996GB gratis). Kami merekomendasikan jenis pekerja ini untuk pekerjaan dengan beban kerja terbesar dan paling padat sumber daya yang memerlukan kapasitas komputasi maksimum. -
R.1X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 1 DPU dengan konfigurasi memori yang dioptimalkan. Kami merekomendasikan jenis pekerja ini untuk beban kerja intensif memori yang sering mengalami kesalahan kehabisan memori atau memerlukan rasio Memori-ke-CPU yang tinggi. -
R.2X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 2 DPU dengan konfigurasi memori yang dioptimalkan. Kami merekomendasikan jenis pekerja ini untuk beban kerja intensif memori yang sering mengalami kesalahan kehabisan memori atau memerlukan rasio Memori-ke-CPU yang tinggi. -
R.4X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 4 DPU dengan konfigurasi memori yang dioptimalkan. Kami merekomendasikan jenis pekerja ini untuk beban kerja intensif memori besar yang sering mengalami kesalahan kehabisan memori atau memerlukan rasio Memori-ke-CPU yang tinggi. -
R.8X— Ketika Anda memilih jenis ini, maka Anda juga memberikan nilai untuk Jumlah pekerja. Setiap pekerja memetakan ke 8 DPU dengan konfigurasi memori yang dioptimalkan. Kami merekomendasikan jenis pekerja ini untuk beban kerja intensif memori yang sangat besar yang sering mengalami kesalahan kehabisan memori atau memerlukan rasio Memori-ke-CPU yang tinggi.
Spesifikasi Jenis Pekerja
Tabel berikut memberikan spesifikasi terperinci untuk semua jenis pekerja G yang tersedia:
Spesifikasi Tipe Pekerja G Tipe Pekerja DPU per Node vCPU Memori (GB) Disk (GB) Ruang Disk Kosong (GB) Pelaksana Spark per Node G.025X 0.25 2 4 84 34 1 G.1X 1 4 16 94 44 1 G.2X 2 8 32 138 78 1 G.4X 4 16 64 256 230 1 G.8X 8 32 128 512 485 1 G.12X 12 48 192 768 741 1 G.16X 16 64 256 1024 996 1 Penting: G.12X dan G.16X tipe pekerja, serta semua tipe pekerja R (R.1X melalui R.8X), memiliki latensi startup yang lebih tinggi.
Anda akan dikenakan tarif per jam berdasarkan jumlah DPU yang digunakan untuk menjalankan tugas ETL Anda. Untuk informasi lebih lanjut, lihat halaman harga AWS Glue
. Untuk pekerjaan AWS Glue versi 1.0 atau sebelumnya, saat Anda mengonfigurasi pekerjaan menggunakan konsol dan menentukan jenis Pek erja Standar, kapasitas maksimum ditetapkan dan Jumlah pekerja menjadi nilai Kapasitas maksimum - 1. Jika Anda menggunakan AWS Command Line Interface (AWS CLI) atau AWS SDK, Anda dapat menentukan parameter kapasitas maksimum, atau Anda dapat menentukan jenis Pek erja dan Jumlah pekerja.
Untuk pekerjaan AWS Glue versi 2.0 atau yang lebih baru, Anda tidak dapat menentukan kapasitas maksimum. Sebaliknya, Anda harus menentukan Jenis pekerja dan Jumlah pekerja.
G.4Xdan tipeG.8Xpekerja hanya tersedia untuk pekerjaan Spark ETL AWS Glue versi 3.0 atau yang lebih baru di Wil AWS ayah berikut: AS Timur (Ohio), AS Timur (Virginia Utara), AS Barat (California Utara), AS Barat (Oregon), Asia Pasifik (Mumbai), Asia Pasifik (Seoul), Asia Pasifik (Singapura), Asia Pasifik (Sydney), Asia Pasifik (Tokyo), Kanada (Tengah), Eropa (Frankfurt), Eropa (Irlandia), Eropa (London), Eropa (Spanyol), Eropa (Stockholm), dan Amerika Selatan (São Paulo).G.12X,G.16X, dan tipeR.8XpekerjaR.1Xmelalui hanya tersedia untuk pekerjaan Spark ETL AWS Glue versi 4.0 atau yang lebih baru di Wil AWS ayah berikut: AS Timur (Virginia Utara), AS Barat (Oregon), AS Timur (Ohio), Eropa (Irlandia), Eropa (Frankfurt), Eropa (Spanyol), Asia Pasifik (Tokyo), dan Amerika Selatan (São Paulo). Wilayah tambahan akan didukung dalam rilis mendatang. -
- Jumlah pekerja yang diminta
-
Untuk sebagian besar jenis pekerja, Anda harus menentukan jumlah pekerja yang dialokasikan saat pekerjaan berjalan.
- Bookmark Tugas
-
Tentukan bagaimana AWS Glue proses menyatakan informasi saat pekerjaan berjalan. Anda dapat membuatnya mengingat data yang diproses sebelumnya, memperbarui informasi status, atau mengabaikan informasi status. Untuk informasi selengkapnya, lihat Melacak data yang diproses menggunakan bookmark pekerjaan.
- Antrian menjalankan pekerjaan
-
Menentukan apakah pekerjaan diantrean secara otomatis ketika pekerjaan tidak dapat langsung dijalankan karena kuota layanan atau kendala sumber daya. Saat diaktifkan, pekerjaan berjalan menunggu dalam antrian dan dimulai secara otomatis saat sumber daya tersedia, alih-alih segera gagal.
Saat dicentang, antrian jalankan pekerjaan diaktifkan untuk semua proses pekerjaan ini. Jika tidak dicentang, proses pekerjaan akan segera gagal ketika sumber daya tidak tersedia.
Antrian menjalankan pekerjaan direkomendasikan untuk:
High-volume Beban kerja ETL yang mungkin melebihi batas pekerjaan bersamaan
Saluran pipa otomatis yang harus tahan terhadap kendala sumber daya sementara
Non-time-sensitive pekerjaan pemrosesan batch
Batasan Kelelahan IP VPC
Untuk VPC-based pekerjaan yang mengalami kelelahan IP: antrian akan aktif hanya jika kekurangan IP terdeteksi pada waktu peluncuran pekerjaan. Jika kehabisan IP terjadi setelah driver dimulai (selama penyediaan eksekutor), pekerjaan akan gagal alih-alih diantri. Untuk menghindari skenario ini:
Pastikan alamat IP yang memadai di subnet VPC Anda
Gunakan blok CIDR sekunder atau awalan subnet yang lebih besar jika diperlukan
Batasi pengiriman pekerjaan VPC secara bersamaan selama periode puncak
Jika pengaturan tingkat pekerjaan ini berbeda dari setelan tingkat proses pekerjaan yang ditentukan saat memulai menjalankan pekerjaan, setelan tingkat proses pekerjaan diutamakan.
- Eksekusi fleksibel
-
Saat Anda mengonfigurasi pekerjaan menggunakan AWS Studio atau API, Anda dapat menentukan kelas eksekusi tugas standar atau fleksibel. Pekerjaan Anda mungkin memiliki tingkat prioritas dan sensitivitas waktu yang bervariasi. Kelas eksekusi standar sangat ideal untuk beban kerja yang sensitif terhadap waktu yang memerlukan startup pekerjaan yang cepat dan sumber daya khusus.
Kelas eksekusi fleksibel sesuai untuk pekerjaan yang tidak mendesak seperti pekerjaan pra-produksi, pengujian, dan pemuatan data satu kali. Pengoperasian pekerjaan yang fleksibel didukung untuk pekerjaan yang menggunakan AWS Glue versi 3.0 atau yang lebih baru dan
G.1XatauG.2Xtipe pekerja. Jenis pekerja baru (G.12X,G.16X, danR.1XmelaluiR.8X) tidak mendukung eksekusi yang fleksibel.Jalankan pekerjaan fleksibel ditagih berdasarkan jumlah pekerja yang berjalan pada suatu titik waktu. Jumlah pekerja dapat ditambahkan atau dihapus untuk menjalankan pekerjaan fleksibel yang berjalan. Alih-alih menagih sebagai perhitungan sederhana dari
Max Capacity*Execution Time, setiap pekerja akan berkontribusi untuk waktu yang dijalankannya selama pekerjaan dijalankan. Tagihan adalah jumlah dari (Number of DPUs per worker*time each worker ran).Untuk informasi selengkapnya, lihat panel bantuan di AWS Studio, atau Lowongan Kerja danTugas berjalan.
- Jumlah percobaan
-
Tentukan berapa kali, dari 0 hingga 10, yang AWS Glue akan secara otomatis memulai ulang pekerjaan jika gagal. Tugas yang mencapai batas habis waktu tidak dimulai ulang.
- Tugas habis waktu
-
Atur waktu eksekusi maksimal dalam satuan menit. Maksimal adalah 7 hari atau 10.080 menit. Jika tidak, pekerjaan akan menimbulkan pengecualian.
Ketika nilai dibiarkan kosong, batas waktu secara default ditetapkan menjadi 2,880 menit untuk Glue versi 4.0 dan sebelumnya, atau 480 menit untuk Glue versi 5.0 dan yang lebih baru.
Setiap AWS Glue pekerjaan yang ada yang memiliki nilai batas waktu lebih dari 7 hari akan default menjadi 7 hari. Misalnya jika Anda menentukan batas waktu 20 hari untuk pekerjaan batch, itu akan dihentikan pada hari ke-7.
Praktik terbaik untuk batas waktu kerja
Pekerjaan ditagih berdasarkan waktu eksekusi. Untuk menghindari biaya tak terduga, konfigurasikan nilai batas waktu yang sesuai dengan waktu eksekusi yang diharapkan dari pekerjaan Anda.
- Properti Lanjutan
-
- Nama file skrip
-
Nama skrip unik untuk pekerjaan Anda. Tidak dapat diberi nama pekerjaan Tanpa judul.
- Jalur skrip
-
Lokasi skrip Amazon S3. Jalurnya harus memiliki format
s3://bucket/prefix/path/. Itu harus diakhiri dengan garis miring (/) dan tidak menyertakan file apa pun. - Metrik Tugas
-
Nyalakan atau matikan pembuatan CloudWatch metrik Amazon saat pekerjaan ini berjalan. Untuk melihat data pemrofilan, Anda harus mengaktifkan opsi ini. Untuk informasi selengkapnya tentang cara mengaktifkan dan memvisualisasikan metrik, lihat Pemantauan dan debugging Job.
- Metrik pengamatan pekerjaan
-
Aktifkan pembuatan CloudWatch metrik pengamatan tambahan saat pekerjaan ini berjalan. Untuk informasi selengkapnya, lihat Pemantauan dengan AWS Glue Metrik observabilitas.
- Pencatatan log berkelanjutan
-
Aktifkan logging terus menerus ke Amazon CloudWatch. Jika opsi ini tidak diaktifkan, maka log hanya tersedia setelah tugas selesai saja. Untuk informasi selengkapnya, lihat Logging untuk AWS Glue pekerjaan.
- Spark UI
-
Hidupkan penggunaan Spark UI untuk memantau tugas ini. Untuk informasi selengkapnya, lihat Mengaktifkan UI web Apache Spark untuk pekerjaan AWS Glue.
- Jalur log Spark UI
-
Jalur untuk menulis log saat Spark UI diaktifkan.
- Konfigurasi logging dan pemantauan Spark UI
-
Pilih salah satu opsi berikut:
Standar: tulis log menggunakan ID run AWS Glue pekerjaan sebagai nama file. Aktifkan pemantauan Spark UI di AWS Glue konsol.
Legacy: tulis log menggunakan 'spark-application- {timestamp} 'sebagai nama file. Jangan aktifkan pemantauan Spark UI.
Standar dan warisan: tulis log ke lokasi standar dan lama. Aktifkan pemantauan Spark UI di AWS Glue konsol.
- Konkurensi maksimum
-
Mengatur jumlah maksimal eksekusi bersamaan yang diperbolehkan untuk tugas ini. Default-nya adalah 1. Kesalahan dikembalikan ketika ambang batas ini tercapai. Nilai maksimal yang dapat Anda tentukan dikendalikan oleh kuota layanan. Sebagai contoh, jika eksekusi tugas sebelumnya masih berjalan ketika sebuah instans baru dimulai, maka Anda mungkin ingin mengembalikan kesalahan untuk mencegah dua instans dari tugas yang sama agar tidak berjalan secara bersamaan.
- Jalur sementara
-
Berikan lokasi direktori kerja di Amazon S3 tempat hasil perantara sementara ditulis saat AWS Glue menjalankan skrip. Konfirmasi bahwa tidak ada file dengan nama yang sama sebagai direktori sementara pada path. Direktori ini digunakan saat AWS Glue membaca dan menulis ke Amazon Redshift dan dengan AWS Glue transformasi tertentu.
catatan
AWS Glue menciptakan ember sementara untuk pekerjaan jika ember belum ada di suatu wilayah. Bucket ini mungkin mengizinkan akses publik. Anda dapat memodifikasi bucket di Amazon S3 untuk mengatur blok akses publik, atau menghapus bucket nanti setelah semua tugas di wilayah tersebut telah selesai.
- Ambang pemberitahuan keterlambatan (menit)
-
Menetapkan ambang batas (dalam menit) sebelum sebuah notifikasi penundaan dikirim. Anda dapat mengatur ambang batas ini untuk mengirim notifikasi ketika eksekusi tugas
RUNNING,STARTING, atauSTOPPINGmemerlukan waktu lebih dari jumlah menit yang diharapkan. - Konfigurasi keamanan
-
Pilih sebuah konfigurasi keamanan dari daftar. Konfigurasi keamanan menentukan bagaimana data di target Amazon S3 dienkripsi: tidak ada enkripsi, enkripsi sisi server dengan kunci AWS KMS-managed (SSE-KMS), atau kunci S3-managed enkripsi Amazon (). SSE-S3
- Server-side enkripsi
-
Jika Anda memilih opsi ini, saat tugas ETL menulis ke Amazon S3, data dienkripsi saat diam menggunakan SSE-S3 enkripsi. Baik target data Amazon S3 Anda dan data yang ditulis ke direktori sementara Amazon S3 , keduanya dienkripsi. Opsi ini diberikan sebagai parameter tugas. Untuk informasi selengkapnya, lihat Melindungi Data Menggunakan Server-Side Enkripsi dengan K S3-Managed unci Enkripsi Amazon (SSE-S3) di Panduan Pengguna Layanan Penyimpanan Sederhana Amazon.
penting
Opsi ini diabaikan jika sebuah konfigurasi keamanan ditentukan.
- Gunakan katalog data Glue sebagai metastore Hive
-
Pilih untuk menggunakan Katalog AWS Glue Data sebagai metastore Hive. IAM role yang digunakan untuk tugas harus memiliki izin
glue:CreateDatabase. Sebuah basis data dengan nama “default” dibuat dalam Katalog Data jika tidak ada.
- Koneksi
-
Pilih konfigurasi VPC untuk mengakses sumber data Amazon S3 yang terletak di cloud pribadi virtual (VPC) Anda. Anda dapat membuat dan mengelola koneksi Jaringan di AWS Glue. Untuk informasi selengkapnya, lihat Menghubungkan ke data.
- Pustaka
-
- Jalur pustaka Python, jalur JAR Dependen, dan jalur file yang direferensikan
-
Tentukan opsi ini jika skrip Anda memerlukannya. Anda dapat menentukan path Amazon S3 yang dipisahkan koma untuk pilihan ini ketika Anda menentukan tugas. Anda dapat mengganti path ini ketika Anda menjalankan tugas. Untuk informasi selengkapnya, lihat Menyediakan skrip kustom Anda sendiri.
- Parameter Tugas
-
Satu set pasangan nilai-kunci yang diberikan sebagai parameter bernama untuk skrip. Ini adalah nilai default yang digunakan ketika skrip dijalankan, tetapi Anda dapat menimpanya di pemicu atau ketika Anda menjalankan tugas. Anda harus memberikan prefiks pada nama kunci dengan
--; misalnya:--myKey. Anda meneruskan parameter pekerjaan sebagai peta saat menggunakan AWS Command Line Interface.Sebagai contoh, lihat parameter Python di Melewati dan mengakses parameter Python di AWS Glue.
- Tanda
-
Tandai tugas Anda dengan Kunci tag dan opsional Nilai tag. Setelah kunci tag dibuat, mereka hanya bisa dibaca. Gunakan tag ke sumber daya Anda untuk membantu mengatur dan mengidentifikasi sumber daya tersebut. Untuk informasi selengkapnya, lihat AWS tag di AWS Glue.
Pembatasan untuk pekerjaan yang mengakses tabel yang dikelola Danau Formation
Ingatlah catatan dan batasan berikut saat membuat pekerjaan yang membaca dari atau menulis ke tabel yang dikelola oleh AWS Lake Formation:
-
Fitur berikut tidak didukung dalam pekerjaan yang mengakses tabel dengan filter tingkat sel: