View a markdown version of this page

Catatan rilis untuk pustaka paralelisme SageMaker model - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Catatan rilis untuk pustaka paralelisme SageMaker model

Lihat catatan rilis berikut untuk melacak pembaruan terbaru untuk pustaka SageMaker model paralelism (SMP). Jika Anda memiliki pertanyaan lebih lanjut tentang perpustakaan SMP, hubungi tim layanan SMP di. sm-model-parallel-feedback@amazon.com

Pust SageMaker aka paralelisme model v2.8.0

Tanggal: 01 April 2025

Pembaruan pustaka SMP

Perbaikan bug

  • Kliping norma gradien SMP sekarang mendukung pelepasan aktivasi.

Kontainer SMP Docker dan Enroot

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SDK SageMaker Python Anda ke v2.243.0 atau yang lebih baru.

Pembaruan mata uang

  • Ditambahkan dukungan untuk PyTorch v2.5.1

  • Dukungan CUDA yang ditingkatkan ke v12.4

  • Dukungan NCCL yang ditingkatkan ke v2.23.4

  • Perpustakaan SMDDP yang ditingkatkan ke 2.6.0

Rincian kontainer

  • Wadah SMP Docker untuk PyTorch v2.5.1 dengan CUDA v12.4

    658645717510.dkr.ecr.<us-west-2>.amazonaws.com/smdistributed-modelparallel:2.5.1-gpu-py311-cu124
  • Wadah SMP Enroot untuk PyTorch v2.5.1 dengan CUDA v12.4

    https://sagemaker-distributed-model-parallel.s3.<us-west-2>.amazonaws.com/enroot/2.5.1-gpu-py311-cu124.sqsh
  • Pre-installed paket

    • Pustaka SMP v2.8.0

    • Pustaka SMDDP v2.6.0

    • CUDNN v9.4.0

    • FlashAttention v2.5.8

    • TransformerEngine v1.10

    • Megatron v0.8.0

    • Transformers Wajah Memeluk v4.44.2

    • Pustaka Kumpulan Data Hugging Face v2.19.0

    • EFA v1.36.0

    • NCCL v2.23.4

    • AWS-OFI-NCCL v1.13.2

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik dari pustaka SMP yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.7.0

Tanggal: 04 Desember 2024

Pembaruan pustaka SMP

Fitur baru

Kontainer SMP Docker dan Enroot

Tim pustaka SMP mendistribusikan wadah Docker dan Enroot sebagai pengganti wadah kerangka kerja. SageMaker PyTorch Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SDK SageMaker Python Anda ke v2.237.0 atau yang lebih baru.

Rincian kontainer

  • Wadah SMP Docker untuk PyTorch v2.4.1 dengan CUDA v12.1

    658645717510.dkr.ecr.<us-west-2>.smdistributed-modelparallel:2.4.1-gpu-py311-cu121
  • Wadah SMP Enroot untuk PyTorch v2.4.1 dengan CUDA v12.1

    https://sagemaker-distributed-model-parallel.s3.<us-west-2>.amazonaws.com/enroot/2.4.1-gpu-py311-cu121.sqsh
  • Pre-installed paket

    • Pustaka SMP v2.7.0

    • Pustaka SMDDP v2.5.0

    • CUDNN v9.4.0

    • FlashAttention v2.5.8

    • TransformerEngine v1.10

    • Megatron v0.8.0

    • Transformers Wajah Memeluk v4.44.2

    • Pustaka Kumpulan Data Hugging Face v2.19.0

    • EFA v1.32.0

    • NCCL v2.21.5

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik dari pustaka SMP yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan Conda seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.6.1

Tanggal: 31 Oktober 2024

Pembaruan pustaka SMP

Perbaikan bug

  • Memperbaiki ImportError masalah yang terjadi saat menggunakan skrip pelatihan lama dengan SMP v2.6.0. Ini memperbaiki ketidakcocokan mundur dengan SMP v2.6.0.

  • Ditambahkan DeprecationWarning untuktorch.sagemaker.distributed.fsdp.checkpoint. Modul ini akan usang dan dihapus di SMP v2.7.0. Jika saat ini Anda menggunakan torch.sagemaker.distributed.fsdp.checkpoint kode Anda, Anda harus merencanakan untuk memperbarui skrip Anda sebelum rilis SMP v2.7.0 untuk menghindari masalah di masa mendatang.

  • Memperbaiki masalah kompatibilitas mundur yang diidentifikasi di SMP v2.6.0. Masalah ini terkait dengan penghentian metode USE_PG_WITH_UTIL pos pemeriksaan di SMP v2.6.0, yang merusak kompatibilitas mundur dengan versi skrip pelatihan sebelumnya. Untuk mengatasi masalah ini, jalankan kembali pekerjaan PyTorch pelatihan Anda untuk mengambil wadah SMP terbaru yang dikemas dengan SMP v2.6.1.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker.

Rincian kontainer

  • Wadah SMP Docker untuk PyTorch v2.4.1 dengan CUDA v12.1

    658645717510.dkr.ecr.<us-west-2>.amazonaws.com/smdistributed-modelparallel:2.4.1-gpu-py311-cu121
  • Pre-installed paket

    • Pustaka SMP v2.6.1

    • Pustaka SMDDP v2.5.0

    • CUDNN v9.4.0

    • FlashAttention v2.5.8

    • TransformerEngine v1.10

    • Megatron v0.8.0

    • Transformers Wajah Memeluk v4.44.2

    • Pustaka Kumpulan Data Hugging Face v2.19.0

    • EFA v1.32.0

    • NCCL v2.21.5

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik dari pustaka SMP yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan sumber daya komputasi yang sangat dapat disesuaikan seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.6.0

Tanggal: 17 Oktober 2024

Pembaruan pustaka SMP

Fitur baru

  • Menambahkan dukungan untuk konfigurasi model LLM berikut. Anda dapat mulai menggunakan Paralelisme konteks danParalelisme tensor.

  • Menambahkan Paralelisme tensor dukungan untuk konfigurasi model Mixtral berikut.

  • Menambahkan dukungan untuk implementasi paralelisme AllGather-based konteks yang memanfaatkan kolektif AllGather komunikasi untuk mendapatkan urutan penuh tensor kunci-dan-nilai. Implementasi yang tersedia adalah p2p danall_gather. p2pImplementasi menggunakan panggilan kirim-terima peer-to-peer untuk akumulasi tensor kunci-dan-nilai (KV) selama perhitungan perhatian, berjalan secara asinkron dan memungkinkan komunikasi tumpang tindih dengan komputasi. Di sisi lain, all_gather implementasi menggunakan operasi kolektif AllGather komunikasi untuk akumulasi tensor KV. Untuk mempelajari cara menerapkan implementasi paralelisme konteks ini, lihat. Paralelisme konteks

  • Menambahkan dukungan untuk menyetel nilai theta Rotary Position Embedding (RoPE).

Perbaikan bug

  • Memperbaiki bug di mana Rotary Position Embedding (RoPE) tidak diinisialisasi dengan benar selama pra-pelatihan ketika parameter tertunda diaktifkan.

Masalah yang diketahui

  • Transformer Engine saat ini tidak mendukung paralelisme konteks atau FP8 dengan perhatian jendela geser diaktifkan. Dengan demikian, versi SMP dari transformer Mistral tidak mendukung paralelisme konteks atau pelatihan FP8 ketika konfigurasi jendela geser diatur ke nilai non-nol.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker.

Pembaruan mata uang

  • Diting PyTorch katkan ke v2.4.1

  • Meningkatkan Megatron ke v0.8.0

  • Meningkatkan per TransformerEngine pustakaan ke v1.10

  • Transformers yang ditingkatkan ke v4.44.2

  • Upgrade cuDNN ke v9.4.0.58

Rincian kontainer

  • Wadah SMP Docker untuk PyTorch v2.4.1 dengan CUDA v12.1

    658645717510.dkr.ecr.<us-west-2>.amazonaws.com/smdistributed-modelparallel:2.4.1-gpu-py311-cu121
  • Pre-installed paket

    • Pustaka SMP v2.6.0

    • Pustaka SMDDP v2.5.0

    • CUDNN v9.4.0

    • FlashAttention v2.5.8

    • TransformerEngine v1.10

    • Megatron v0.8.0

    • Transformers Wajah Memeluk v4.44.2

    • Pustaka Kumpulan Data Hugging Face v2.19.0

    • EFA v1.32.0

    • NCCL v2.21.5

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik dari pustaka SMP yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan sumber daya komputasi yang sangat dapat disesuaikan seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.5.0

Tanggal: 28 Agustus 2024

Pembaruan pustaka SMP

Fitur baru

  • Menambahkan dukungan untuk pelatihan presisi campuran menggunakan format data FP8 pada instance P5 untuk model Mixtral.

  • Menambahkan dukungan Paralelisme konteks untuk konfigurasi model berikut.

    • Llama-v2: 7B dan 70B

    • Llama-v3: 8B dan 70B

    • GPT-NeoX: 20B

  • Menambahkan dukungan untuk menyimpan pos pemeriksaan secara asinkron. Untuk mempelajari selengkapnya, lihat Pemeriksaan menggunakan SMP.

    • Dukungan untuk menyimpan pos pemeriksaan ke S3 secara langsung tanpa menggunakan Amazon EBS atau server file.

Perbaikan bug

  • Menyelesaikan masalah yang menyebabkan kerugian awal yang tinggi secara tak terduga selama penyetelan Llama saat memuat pos pemeriksaan model yang telah dilatih sebelumnya dan menggunakan paralelisme tensor.

Catatan

  • Untuk menggunakan checkpointing aktivasi untuk Mixtral dengan presisi campuran FP8, Anda perlu memeriksa lapisan perhatian dan ahli secara terpisah. Untuk contoh pengaturannya dengan benar, lihat contoh skrip pelatihan di repositori Contoh SageMaker AI Amazon.

Masalah yang diketahui

  • Jenis penyeimbangan beban seimbang dalam konfigurasi MoE (Torch.sagemaker.moe.moe_config.moeconfig) saat ini tidak kompatibel dengan checkpointing aktivasi.

  • Dengan paralelisme konteks, GPT-NeoX menunjukkan regresi kinerja baik dalam pra-pelatihan maupun penyempurnaan.

  • Untuk inst GPT-NeoX ans P4, pemuatan bobot langsung dari model transformasi parameter tertunda yang diinisialisasi menjadi model transformator Hugging Face menyebabkan ketidakcocokan kerugian pada langkah pertama.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SageMaker Python SDK Anda ke v2.224.0 atau yang lebih baru.

Pembaruan mata uang

Rincian kontainer

  • Wadah SMP Docker untuk PyTorch v2.3.1 dengan CUDA v12.1

    658645717510.dkr.ecr.<region>.amazonaws.com/smdistributed-modelparallel:2.3.1-gpu-py311-cu121

    Untuk daftar lengkap wilayah yang didukung, lihatWilayah AWS.

  • Pre-installed paket

    • Pustaka SMP v2.5.0

    • Pustaka SMDDP v2.3.0

    • CUDNN v8.9.7.29

    • FlashAttention v2.5.8

    • TransformerEngine v1.8

    • Megatron v0.7.0

    • Transformers Wajah Memeluk v4.40.1

    • Pustaka Kumpulan Data Hugging Face v2.19.0

    • EFA v1.32.0

    • NCCL v2.21.5

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik dari pustaka SMP yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan sumber daya komputasi yang sangat dapat disesuaikan seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.4.0

Tanggal: 20 Juni 2024

Pembaruan pustaka SMP

Perbaikan bug

  • Memperbaiki bug yang menyebabkan bentuk logit yang salah saat label tidak dilewatkan dalam pass maju saat menggunakan Transformer SMP.

Pembaruan mata uang

  • Menambahkan dukungan untuk PyTorch v2.3.1.

  • Menambahkan dukungan untuk Python v3.11.

  • Menambahkan dukungan untuk pustaka Hugging Face Transformers v4.40.1.

Penghentian

  • Dukungan yang dihentikan untuk Python v3.10.

  • Dukungan dihentikan untuk versi pustaka Hugging Face Transformers sebelum v4.40.1.

Perubahan lainnya

  • Termasuk tambalan untuk beralih menyimpan tensor yang tidak diduplikasi pada peringkat yang berbeda. Untuk mempelajari lebih lanjut, lihat ut as diskusi di PyTorch GitHub repositori.

Masalah yang diketahui

  • Ada masalah yang diketahui bahwa kerugian mungkin melonjak dan kemudian berlanjut pada nilai kerugian yang lebih tinggi saat menyempurnakan Llama-3 70B dengan paralelisme tensor.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SageMaker Python SDK Anda ke v2.224.0 atau yang lebih baru.

Pembaruan mata uang

  • Memutakhirkan pustaka SMDDP ke v2.3.0.

  • Memutakhirkan pustaka NCCL ke v2.21.5.

  • Upgrade perangkat lunak EFA ke v1.32.0.

Penghentian

Rincian kontainer

  • Wadah SMP Docker untuk PyTorch v2.3.1 dengan CUDA v12.1

    658645717510.dkr.ecr.us-west-2.amazonaws.com/smdistributed-modelparallel:2.3.1-gpu-py311-cu121
  • Pre-installed paket

    • Pustaka SMP v2.4.0

    • Perpustakaan SMDDP v2.3.0

    • CUDNN v8.9.7.29

    • FlashAttention v2.3.3

    • TransformerEngine v1.2.1

    • Transformers Wajah Memeluk v4.40.1

    • Pustaka Kumpulan Data Hugging Face v2.19.0

    • EFA v1.32.0

    • NCCL v2.21.5

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik dari pustaka SMP yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan sumber daya komputasi yang sangat dapat disesuaikan seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.3.1

Tanggal: 9 Mei 2024

Perbaikan bug

  • Memperbaiki ImportError masalah saat menggunakan moe_load_balancing=balanced paral Torch.sagemaker.moe.moe_config.moeconfig elisme ahli.

  • Memperbaiki masalah penyempurnaan KeyError saat obor.sagemaker.transform panggilan load_state_dict_from_rank0 diaktifkan.

  • Memperbaiki kesalahan kehabisan memori (OOM) yang muncul saat memuat model Campuran Ahli (MoE) besar, seperti Mixtral 8x22B, untuk penyetelan halus.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Rilis ini menggabungkan perbaikan bug yang disebutkan di atas ke dalam gambar SMP Docker berikut.

  • Wadah SMP Docker untuk PyTorch v2.2.0 dengan CUDA v12.1

    658645717510.dkr.ecr.us-west-2.amazonaws.com/smdistributed-modelparallel:2.2.0-gpu-py310-cu121

Pust SageMaker aka paralelisme model v2.3.0

Tanggal: 11 April 2024

Fitur baru

  • Menambahkan fitur inti baru, paralelisme ahli, untuk mendukung model transformator Campuran Ahli. Untuk mempelajari selengkapnya, lihat Paralelisme ahli.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SageMaker Python SDK Anda ke v2.214.4 atau yang lebih baru.

  • Wadah SMP Docker untuk PyTorch v2.2.0 dengan CUDA v12.1

    658645717510.dkr.ecr.us-west-2.amazonaws.com/smdistributed-modelparallel:2.2.0-gpu-py310-cu121
    • Pre-installed paket dalam wadah Docker ini

      • Perpustakaan SMDDP v2.2.0

      • CUDNN v8.9.5.29

      • FlashAttention v2.3.3

      • TransformerEngine v1.2.1

      • Transformers Wajah Memeluk v4.37.1

      • Pustaka Kumpulan Data Hugging Face v2.16.1

      • Megatron-core 0.5.0

      • EFA v1.30.0

      • NCCL v2.19.4

Pust SageMaker aka paralelisme model v2.2.0

Tanggal: 7 Maret 2024

Fitur Baru

  • Menambahkan dukungan untuk pelatihan FP8 dari model transformator Hugging Face berikut pada instans P5 dengan integrasi Transformer Engine:

    • GPT-NeoX

    • Lama 2

Perbaikan Bug

  • Memperbaiki bug di mana tensor tidak dijamin bersebelahan sebelum panggilan AllGather kolektif selama pelatihan paralelisme tensor.

Pembaruan Mata Uang

  • Menambahkan dukungan untuk PyTorch v2.2.0.

  • Memutakhirkan pustaka SMDDP ke v2.2.0.

  • Memutakhirkan FlashAttention perpustakaan ke v2.3.3.

  • Memutakhirkan pustaka NCCL ke v2.19.4.

Penghentian

  • Dukungan dihentikan untuk versi Transformer Engine sebelum v1.2.0.

Masalah yang diketahui

  • Pelepasan aktivasiFitur SMP saat ini tidak berfungsi. Gunakan offloading PyTorch aktivasi asli sebagai gantinya.

Perubahan lainnya

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SageMaker Python SDK Anda ke v2.212.0 atau yang lebih baru.

  • Wadah SMP Docker untuk PyTorch v2.2.0 dengan CUDA v12.1

    658645717510.dkr.ecr.us-west-2.amazonaws.com/smdistributed-modelparallel:2.2.0-gpu-py310-cu121
    • Tersedia untuk instans P4d, P4de, dan P5

    • Pre-installed paket dalam wadah Docker ini

      • Perpustakaan SMDDP v2.2.0

      • CUDNN v8.9.5.29

      • FlashAttention v2.3.3

      • TransformerEngine v1.2.1

      • Transformers Wajah Memeluk v4.37.1

      • Pustaka Kumpulan Data Hugging Face v2.16.1

      • EFA v1.30.0

      • NCCL v2.19.4

Pust SageMaker aka paralelisme model v2.1.0

Tanggal: 6 Februari 2024

Pembaruan Mata Uang

  • Menambahkan dukungan untuk PyTorch v2.1.2.

Penghentian

  • Dukungan dihentikan untuk Hugging Face Transformers v4.31.0.

Masalah yang diketahui

  • Masalah ditemukan bahwa penyempurnaan model Hugging Face Llama 2 dengan attn_implementation=flash_attention_2 dan FSDP menyebabkan model menyimpang. Untuk referensi, lihat tiket masalah di GitHub repositori Hugging Face Transformers. Untuk menghindari masalah divergensi, gunakanattn_implementation=sdpa. Atau, gunakan implementasi model transformator SMP dengan mengaturuse_smp_implementation=True.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SageMaker Python SDK Anda ke v2.207.0 atau yang lebih baru.

  • Wadah SMP Docker untuk PyTorch v2.1.2 dengan CUDA v12.1

    658645717510.dkr.ecr.us-west-2.amazonaws.com/smdistributed-modelparallel:2.1.2-gpu-py310-cu121
    • Tersedia untuk instans P4d, P4de, dan P5

    • Pre-installed paket dalam wadah Docker ini

      • Pustaka SMDDP v2.1.0

      • CUDNN v8.9.5.29

      • FlashAttention v2.3.3

      • TransformerEngine v1.2.1

      • Transformers Wajah Memeluk v4.37.1

      • Pustaka Kumpulan Data Hugging Face v2.16.1

      • EFA v1.30.0

Saluran SMP Conda

Bucket S3 berikut adalah saluran Conda publik yang dihosting oleh tim layanan SMP. Jika Anda ingin menginstal pustaka SMP v2 di lingkungan sumber daya komputasi yang sangat dapat disesuaikan seperti SageMaker HyperPod cluster, gunakan saluran Conda ini untuk menginstal pustaka SMP dengan benar.

  • https://sagemaker-distributed-model-parallel.s3.us-west-2.amazonaws.com/smp-v2/

Untuk informasi selengkapnya tentang saluran Conda secara umum, lihat Sal uran di dokumentasi Conda.

Pust SageMaker aka paralelisme model v2.0.0

Tanggal: 19 Desember 2023

Fitur baru

Merilis pust SageMaker aka model paralelism (SMP) v2.0.0 dengan penawaran baru berikut.

  • torch.sagemakerPaket baru, sepenuhnya dirubah dari smdistributed.modelparallel.torch paket sebelumnya di SMP v1.x.

  • Dukungan untuk PyTorch 2.0.1.

  • Dukungan untuk PyTorch FSDP.

  • Implementasi paralelisme tensor dengan mengintegrasikan dengan pustaka Transformer Engine.

  • Dukungan untuk Pel SageMaker atihan dan SageMaker HyperPod.

Melanggar perubahan

  • SMP v2 mengubah API sepenuhnya dan menyediakan paket. torch.sagemaker Sebagian besar, Anda hanya perlu menginisialisasi dengan torch.sagemaker.init() modul dan melewati parameter konfigurasi paralel model. Dengan paket baru ini, Anda dapat secara signifikan menyederhanakan modifikasi kode dalam skrip pelatihan Anda. Untuk mempelajari lebih lanjut tentang mengadaptasi skrip pelatihan Anda untuk menggunakan SMP v2, lihatGunakan perpustakaan paralelisme SageMaker model v2.

  • Jika Anda telah menggunakan SMP v1 untuk melatih model Hugging Face Transformer dan ingin menggunakan kembali model di SMP v2, lihat. Tingkatkan dari SMP v1 ke SMP v2

  • Untuk pelatihan PyTorch FSDP, Anda harus menggunakan SMP v2.

Masalah yang diketahui

  • Checkpoint aktivasi saat ini hanya berfungsi dengan kebijakan pembungkus berikut dengan FSDP.

    • auto_wrap_policy = functools.partial(transformer_auto_wrap_policy, ...)

  • Untuk menggunakanPelepasan aktivasi, tipe checkpoint aktivasi FSDP harus REENTRANT. https://pytorch.org/docs/stable/checkpoint.html

  • Saat menjalankan dengan paralel tensor diaktifkan dengan derajat paralel data sharded disetel ke1, Anda harus menggunakan. backend = nccl Opsi smddp backend tidak didukung dalam skenario ini.

  • Transformer Engine diperlukan untuk digunakan PyTorch dengan pustaka SMP bahkan ketika tidak menggunakan paralelisme tensor.

Perubahan lainnya

  • Mulai dari rilis ini, dokumentasi untuk pust SageMaker aka paralelisme model sepenuhnya tersedia di Panduan Pengembang SageMaker AI Amazon ini. Untuk mendukung panduan pengembang lengkap untuk SMP v2 ini di Panduan Pengembang SageMaker AI Amazon, referensi tambahan untuk SMP v1.x dalam dokumentasi SageMaker Python SDK tidak digunakan lagi. Jika Anda masih memerlukan dokumentasi untuk SMP v1.x, panduan pengembang untuk SMP v1.x tersedia di(Diarsipkan) perpustakaan SageMaker paralelisme model v1.x, dan referensi pustaka SMP Python v1.x tersedia di dokumentasi Python SDK v2.199.0. SageMaker

Penghentian

  • Dukungan dihentikan untuk TensorFlow.

  • Tidak ada dukungan paralelisme pipa di SMP v2.

  • Tidak ada dukungan untuk per DeepSpeed pustakaan yang mendukung PyTorch FSDP asli.

Wadah SMP Docker

Tim pustaka SMP mendistribusikan kontainer Docker sebagai pengganti wadah SageMaker PyTorch kerangka kerja. Jika Anda menggunakan PyTorch ModelTrainer kelas di SageMaker Python SDK dan menentukan konfigurasi distribusi untuk menggunakan SMP v2, SageMaker AI secara otomatis mengambil wadah SMP Docker. Untuk menggunakan rilis SMP v2 ini, tingkatkan SageMaker Python SDK Anda ke v2.207.0 atau yang lebih baru.

  • Wadah SMP Docker untuk PyTorch v2.0.1 dengan CUDA v12.1

    658645717510.dkr.ecr.us-west-2.amazonaws.com/smdistributed-modelparallel:2.0.1-gpu-py310-cu121