View a markdown version of this page

Amazon EMR pada rilis EKS 6.8.0 - Amazon EMR

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Amazon EMR pada rilis EKS 6.8.0

Rilis Amazon EMR 6.8.0 berikut tersedia untuk Amazon EMR di EKS. Pilih rilis EMR-6.8.0-xxxx tertentu untuk melihat detail selengkapnya seperti tag gambar kontainer terkait.

Catatan rilis untuk Amazon EMR 6.8.0

  • Aplikasi yang didukung ‐ AWS SDK untuk Java 1.12.170, Spark 3.3.0-amzn-0, Hudi 0.11.1-amzn-0, Iceberg 0.14.0-amzn-0.

  • Komponen yang didukung ‐ aws-sagemaker-spark-sdk emr-ddbemr-goodies,,emr-s3-select,emrfs,hadoop-client,hudi,hudi-spark,iceberg,spark-kubernetes.

  • Klasifikasi konfigurasi yang didukung:

    Klasifikasi Deskripsi

    core-site

    Ubah nilai dalam file core-site.xml Hadoop.

    emrfs-site

    Ubah pengaturan EMRFS.

    spark-metrics

    Ubah nilai dalam file metrics.properties Spark.

    spark-defaults

    Ubah nilai dalam file spark-defaults.conf Spark.

    spark-env

    Ubah nilai di lingkungan Spark.

    spark-hive-site

    Ubah nilai dalam file hive-site.xml Spark.

    spark-log4j

    Ubah nilai dalam file log4j.properties Spark.

    Klasifikasi konfigurasi memungkinkan Anda menyesuaikan aplikasi. Ini sering kali bersesuaian dengan file XML konfigurasi untuk aplikasi, seperti spark-hive-site.xml. Untuk informasi selengkapnya, lihat Meng onfigurasi Aplikasi.

Fitur penting

  • Spark3.3.0‐ Amazon EMR di EKS 6.8 menyertakan Spark 3.3.0, yang mendukung penggunaan label pemilih node terpisah untuk pod eksekutor driver Spark. Label baru ini memungkinkan Anda menentukan jenis node untuk pod driver dan eksekutor secara terpisah di StartJobRun API, tanpa menggunakan templat pod.

    • Properti pemilih simpul driver: spark.kubernetes.driver.node.selector. [Kunci label]

    • Properti pemilih simpul eksekutor: spark.kubernetes.executor.node.selector. [Kunci label]

  • Pesan kegagalan pekerjaan yang ditingkatkan - Rilis ini memperkenalkan konfigurasi spark.stage.extraDetailsOnFetchFailures.enabled dan spark.stage.extraDetailsOnFetchFailures.maxFailuresToInclude melacak kegagalan tugas karena kode pengguna. Rincian ini akan digunakan untuk meningkatkan pesan kegagalan yang ditampilkan di log pengemudi ketika tahap dibatalkan karena kegagalan pengambilan shuffle.

    Nama properti Nilai default Arti Sejak versi

    spark.stage.extraDetailsOnFetchFailures.enabled

    false

    Jika diset true el ke, properti ini digunakan untuk meningkatkan pesan kegagalan pekerjaan yang ditampilkan di log driver saat tahap dibatalkan karena kegagalan Shuffle Fetch. Secara default, 5 kegagalan tugas terakhir yang disebabkan oleh kode pengguna dilacak, dan pesan kesalahan kegagalan ditambahkan di Log Driver.

    Untuk meningkatkan jumlah kegagalan tugas dengan pengecualian pengguna untuk dilacak, lihat konfigurasispark.stage.extraDetailsOnFetchFailures.maxFailuresToInclude.

    emr-6.8

    spark.stage.extraDetailsOnFetchFailures.maxFailuresToInclude

    5

    Jumlah kegagalan tugas untuk dilacak per tahap dan upaya. Properti ini digunakan untuk meningkatkan pesan kegagalan pekerjaan dengan pengecualian pengguna yang ditampilkan di log driver saat tahap dibatalkan karena kegagalan Shuffle Fetch.

    Properti ini hanya berfungsi jika Config spark.stage.extra DetailsOnFetchFailures.enabled disetel ke true.

    emr-6.8

Untuk informasi selengkapnya lihat dokumentasi konfigurasi Apache Spark.

Masalah yang diketahui

  • Amazon EMR di EKS 6.8.0 salah mengisi hash build di metadata file Parquet yang dihasilkan menggunakan Apache Spark. Masalah ini dapat menyebabkan alat yang mengurai string versi metadata dari file Parquet yang dihasilkan oleh Amazon EMR di EKS 6.8.0 gagal. Pelanggan yang mengurai string versi dari metadata Parquet dan bergantung pada hash build harus beralih ke versi Amazon EMR yang berbeda dan menulis ulang file.

Masalah terselesaikan

  • Kemampuan Interupsi Kernel untuk kernel PySpark ‐ Beban kerja interaktif yang sedang berlangsung yang dipicu oleh mengeksekusi sel di buku catatan dapat dihentikan dengan menggunakan kemampuan. Interrupt Kernel Perbaikan telah diperkenalkan sehingga fungsi ini berfungsi untuk kernel PySpark. Ini juga tersedia dalam sumber terbuka di Perubahan untuk menangani interupsi untuk PySpark Kubernetes Kernel #1115.