Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Pelatihan model
Tahap pelatihan siklus hidup pembelajaran mesin (ML) lengkap mencakup mulai dari mengakses kumpulan data pelatihan Anda hingga menghasilkan model akhir dan memilih model berkinerja terbaik untuk penerapan. Bagian berikut memberikan ikhtisar fitur SageMaker pelatihan dan sumber daya yang tersedia dengan informasi teknis mendalam untuk masing-masing.
SageMaker Lowongan AI Training
Dengan pekerjaan pelatihan Amazon SageMaker AI, layanan yang dikelola sepenuhnya, Anda dapat melatih berbagai AI/ML model secara efisien dalam skala besar. Inti dari pekerjaan pelatihan SageMaker AI adalah kontainerisasi beban kerja ML dan kemampuan mengelola AWS sumber daya komputasi. Platform SageMaker Pelatihan AI menangani pekerjaan berat yang terkait dengan pengaturan dan pengelolaan infrastruktur untuk beban kerja pelatihan ML. Dengan pekerjaan pelatihan SageMaker AI, Anda dapat fokus mengembangkan, melatih, dan menyempurnakan model Anda. Halaman ini memperkenalkan tiga cara yang disarankan untuk memulai dengan melatih model tentang SageMaker AI, diikuti oleh opsi tambahan yang dapat Anda pertimbangkan.
Untuk menyesuaikan model dasar menggunakan SageMaker Pekerjaan Pelatihan AI, lihatSageMaker Lowongan AI Training.
Arsitektur dasar Pel SageMaker atihan
Jika Anda menggunakan SageMaker AI untuk pertama kalinya dan ingin menemukan solusi ML cepat untuk melatih model pada dataset Anda, pertimbangkan untuk menggunakan solusi tanpa kode atau kode rendah seperti SageMaker Canvas, JumpStart dalam SageMaker Studio Classic, atau SageMaker Autopilot.
Untuk pengalaman pengkodean tingkat menengah, pertimbangkan untuk menggunakan notebook SageMaker Studio Classic atau Inst SageMaker ans Notebook. Untuk memulai, ikuti petunjuk di Latih Model panduan SageMaker Mem ulai AI. Kami merekomendasikan ini untuk kasus penggunaan di mana Anda membuat model dan skrip pelatihan Anda sendiri menggunakan kerangka kerja ML.
Inti dari pekerjaan SageMaker AI adalah kontainerisasi beban kerja ML dan kemampuan mengelola sumber daya komputasi. Platform SageMaker Pelatihan menangani pekerjaan berat yang terkait dengan pengaturan dan pengelolaan infrastruktur untuk beban kerja pelatihan ML. Dengan SageMaker Pelatihan, Anda dapat fokus mengembangkan, melatih, dan menyempurnakan model Anda.
Diagram arsitektur berikut menunjukkan bagaimana SageMaker AI mengelola pekerjaan pelatihan ML dan menyediakan instans Amazon EC2 atas nama pengguna SageMaker AI. Anda sebagai pengguna SageMaker AI dapat membawa dataset pelatihan Anda sendiri, menyimpannya ke Amazon S3. Anda dapat memilih pelatihan model ML dari algoritma bawaan SageMaker AI yang tersedia, atau membawa skrip pelatihan Anda sendiri dengan model yang dibuat dengan kerangka kerja pembelajaran mesin populer.
Tampilan lengkap alur kerja dan fitur Pelatihan SageMaker
Perjalanan penuh pelatihan ML melibatkan tugas-tugas di luar konsumsi data ke model ML, model pelatihan pada instance komputasi, dan memperoleh artefak dan keluaran model. Anda perlu mengevaluasi setiap fase sebelum, selama, dan setelah pelatihan untuk memastikan model Anda dilatih dengan baik untuk memenuhi akurasi target untuk tujuan Anda.
Bagan alir berikut menunjukkan ikhtisar tingkat tinggi tindakan Anda (dalam kotak biru) dan fitur Pel SageMaker atihan yang tersedia (dalam kotak biru muda) sepanjang fase pelatihan siklus hidup ML.
Bagian berikut memandu Anda melalui setiap fase pelatihan yang digambarkan dalam diagram alir sebelumnya dan fitur berguna yang ditawarkan oleh SageMaker AI di seluruh tiga sub-tahap pelatihan ML.
Sebelum pelatihan
Ada sejumlah skenario pengaturan sumber daya data dan akses yang perlu Anda pertimbangkan sebelum pelatihan. Lihat diagram berikut dan detail dari setiap tahap sebelum pelatihan untuk memahami keputusan apa yang perlu Anda buat.
-
Siapkan data: Sebelum pelatihan, Anda harus menyelesaikan pembersihan data dan rekayasa fitur selama tahap persiapan data. SageMaker AI memiliki beberapa alat pelabelan dan fitur rekayasa untuk membantu Anda. Lihat Label Data, Men yiapkan dan Menganalisis Kumpulan Data, Memproses Data, dan Membuat, Menyimpan, dan Berbagi Fitur untuk informasi selengkapnya.
-
Pilih algoritma atau kerangka kerja: Tergantung pada seberapa banyak penyesuaian yang Anda butuhkan, ada opsi berbeda untuk algoritma dan kerangka kerja.
-
Jika Anda lebih suka implementasi kode rendah dari algoritma pra-bangun, gunakan salah satu algoritma bawaan yang ditawarkan oleh SageMaker AI. Untuk informasi selengkapnya, lihat Memilih Algoritma.
-
Jika Anda membutuhkan lebih banyak fleksibilitas untuk menyesuaikan model Anda, jalankan skrip pelatihan Anda menggunakan kerangka kerja dan toolkit pilihan Anda dalam SageMaker AI. Untuk informasi selengkapnya, lihat Ker angka Kerja dan Toolkit ML.
-
Untuk memperluas image SageMaker AI Docker yang sudah dibuat sebelumnya sebagai image dasar wadah Anda sendiri, lihat Menggunakan gambar Pre-built SageMaker AI Docker.
-
Untuk membawa wadah Docker kustom Anda ke SageMaker AI, lihat Meng adaptasi wadah Docker Anda sendiri untuk bekerja dengan SageMaker AI. Anda perlu menginstal sagemaker-train
ing-toolkit ke wadah Anda.
-
-
Mengelola penyimpanan data: Mem ahami pemetaan antara penyimpanan data (seperti Amazon S3, Amazon EFS, atau Amazon FSx) dan wadah pelatihan yang berjalan di instans komputasi Amazon EC2. SageMaker AI membantu memetakan jalur penyimpanan dan jalur lokal di wadah pelatihan. Anda juga dapat menentukannya secara manual. Setelah pemetaan selesai, pertimbangkan untuk menggunakan salah satu mode transmisi data: File, Pipa, dan FastFile mode. Untuk mempelajari cara SageMaker AI memetakan jalur penyimpanan, lihat Folder Penyimpanan Pelatihan.
-
Siapkan akses ke data pelatihan: Gunakan domain SageMaker AI Amazon, profil pengguna domain, IAM, Amazon VPC, dan AWS KMS untuk memenuhi persyaratan organisasi yang paling sensitif terhadap keamanan.
-
Untuk administrasi akun, lihat domain Amazon SageMaker AI.
-
Untuk referensi lengkap tentang kebijakan dan keamanan IAM, lihat Keamanan di Amazon SageMaker AI.
-
-
Alirkan data input Anda: SageMaker AI menyediakan tiga mode input data, File, Pipa, dan FastFile. Mode input default adalah mode File, yang memuat seluruh dataset selama menginisialisasi pekerjaan pelatihan. Untuk mempelajari praktik terbaik umum untuk streaming data dari penyimpanan data ke wadah pelatihan, lihat Meng akses Data Pelatihan.
Dalam kasus mode Pipe, Anda juga dapat mempertimbangkan untuk menggunakan file manifes tambahan untuk mengalirkan data Anda langsung dari Amazon Simple Storage Service (Amazon S3) dan melatih model Anda. Menggunakan mode pipa mengurangi ruang disk karena Amazon Elastic Block Store hanya perlu menyimpan artefak model akhir Anda, daripada menyimpan dataset pelatihan lengkap Anda. Untuk informasi selengkapnya, lihat Men yediakan Metadata Dataset ke Pekerjaan Pelatihan dengan File Manifest Augmented.
-
Analisis data Anda untuk bias: Sebelum pelatihan, Anda dapat menganalisis kumpulan data dan model bias terhadap kelompok yang tidak disukai sehingga Anda dapat memeriksa apakah model Anda mempelajari kumpulan data yang tidak bias menggunakan SageMaker Clarify.
-
Pilih SageMaker SDK mana yang akan digunakan: Ada dua cara untuk meluncurkan pekerjaan pelatihan di SageMaker AI: menggunakan SageMaker AI Python SDK tingkat tinggi, atau menggunakan SageMaker API tingkat rendah untuk SDK untuk Python (Boto3) atau. AWS CLI SageMaker Python SDK mengabstraksi SageMaker API tingkat rendah untuk menyediakan alat yang nyaman. Seperti yang disebutkan di atasArsitektur dasar Pel SageMaker atihan, Anda juga dapat mengejar opsi tanpa kode atau kode minimum menggunakan SageMaker Canvas, JumpStart dalam SageMaker Studio Classic, atau SageMaker AI Autopilot.
Selama pelatihan
Selama pelatihan, Anda perlu terus meningkatkan stabilitas pelatihan, kecepatan pelatihan, efisiensi pelatihan sambil menskalakan sumber daya komputasi, pengoptimalan biaya, dan, yang paling penting, kinerja model. Baca terus untuk informasi lebih lanjut tentang tahapan selama pelatihan dan fitur Pel SageMaker atihan yang relevan.
-
Menyiapkan infrastruktur: Pilih jenis instans dan alat manajemen infrastruktur yang tepat untuk kasus penggunaan Anda. Anda dapat memulai dari instance kecil dan meningkatkan skala tergantung pada beban kerja Anda. Untuk melatih model pada dataset tabular, mulailah dengan instance CPU terkecil dari keluarga instance C4 atau C5. Untuk melatih model besar untuk visi komputer atau pemrosesan bahasa alami, mulailah dengan instance GPU terkecil dari keluarga instans P2, P3, G4dn atau G5. Anda juga dapat mencampur berbagai jenis instans dalam cluster, atau menyimpan instans di kumpulan hangat menggunakan alat manajemen instans berikut yang ditawarkan oleh SageMaker AI. Anda juga dapat menggunakan cache persisten untuk mengurangi latensi dan waktu yang dapat ditagih pada pekerjaan pelatihan berulang di atas pengurangan latensi dari kolam hangat saja. Untuk mempelajari lebih lanjut, lihat topik berikut.
Anda harus memiliki kuota yang cukup untuk menjalankan pekerjaan pelatihan. Jika Anda menjalankan pekerjaan pelatihan pada instans di mana kuota Anda tidak mencukupi, Anda akan menerima
ResourceLimitExceededkesalahan. Untuk memeriksa kuota yang tersedia saat ini di akun Anda, gunakan konsol Kuota Layanan Anda. Untuk mempelajari cara meminta kenaikan kuota, lihat Wilayah dan Kuota yang Didukung. Selain itu, untuk menemukan informasi harga dan jenis instans yang tersedia tergantung pada Wilayah AWS, cari tabel di halaman SageMaker Harga Amazon. -
Jalankan pekerjaan pelatihan dari kode lokal: Anda dapat membuat anotasi kode lokal Anda dengan dekorator jarak jauh untuk menjalankan kode Anda sebagai pekerjaan SageMaker pelatihan dari dalam Amazon SageMaker Studio Classic, SageMaker notebook Amazon atau dari lingkungan pengembangan terintegrasi lokal Anda. Untuk informasi selengkapnya, lihat Jalankan kode lokal Anda sebagai pekerjaan SageMaker pelatihan.
-
Lacak pekerjaan pelatihan: Pan tau dan lacak pekerjaan pelatihan Anda menggunakan SageMaker Eksperimen, SageMaker Debugger, atau Amazon CloudWatch. Anda dapat menonton kinerja model dalam hal akurasi dan konvergensi, dan menjalankan analisis komparatif metrik antara beberapa pekerjaan pelatihan dengan menggunakan Eksper SageMaker imen AI. Anda dapat melihat tingkat pemanfaatan sumber daya komputasi dengan menggunakan alat profil SageMaker Debugger atau Amazon. CloudWatch Untuk mempelajari lebih lanjut, lihat topik berikut.
Selain itu, untuk tugas pembelajaran mendalam, gunakan alat debugging model Amazon SageMaker Debugger dan aturan bawaan untuk mengidentifikasi masalah yang lebih kompleks dalam proses konvergensi model dan pembaruan bobot.
-
Pelatihan ter distribusi: Jika pekerjaan pelatihan Anda memasuki tahap yang stabil tanpa putus karena salah konfigurasi infrastruktur pelatihan atau masalah kehabisan memori, Anda mungkin ingin mencari lebih banyak opsi untuk meningkatkan skala pekerjaan Anda dan menjalankan dalam jangka waktu yang lama selama berhari-hari bahkan berbulan-bulan. Saat Anda siap untuk meningkatkan skala, pertimbangkan pelatihan terdistribusi. SageMaker AI menyediakan berbagai opsi untuk komputasi terdistribusi mulai dari beban kerja ML ringan hingga beban kerja pembelajaran mendalam yang berat.
Untuk tugas pembelajaran mendalam yang melibatkan pelatihan model yang sangat besar pada kumpulan data yang sangat besar, pertimbangkan untuk menggunakan salah satu strategi pelatihan terdistribusi SageMaker AI untuk meningkatkan dan mencapai paralelisme data, paralelisme model, atau kombinasi keduanya. Anda juga dapat menggunakan Tra SageMaker ining Compiler untuk mengkompilasi dan mengoptimalkan grafik model pada instans GPU. Fitur SageMaker AI ini mendukung kerangka kerja pembelajaran mendalam seperti PyTorch, TensorFlow, dan Hugging Face Transformers.
-
Penyetelan hyperparameter model: Set el hyperparameter model Anda menggunakan Penyetelan Model Otomatis dengan SageMaker AI. SageMaker AI menyediakan metode penyetelan hyperparameter seperti pencarian grid dan pencarian Bayesian, meluncurkan pekerjaan penyetelan hyperparameter paralel dengan fungsionalitas penghentian awal untuk pekerjaan penyetelan hyperparameter yang tidak meningkatkan.
-
Checkpoint dan penghematan biaya dengan instans Spot: Jika waktu pelatihan tidak menjadi masalah besar, Anda dapat mempertimbangkan untuk mengoptimalkan biaya pelatihan model dengan instans Spot terkelola. Perhatikan bahwa Anda harus mengaktifkan checkpointing untuk pelatihan Spot agar tetap memulihkan dari jeda pekerjaan intermiten karena penggantian instans Spot. Anda juga dapat menggunakan fungsionalitas checkpointing untuk membuat cadangan model Anda jika terjadi pemutusan pekerjaan pelatihan yang tidak terduga. Untuk mempelajari lebih lanjut, lihat topik berikut.
Setelah pelatihan
Setelah pelatihan, Anda mendapatkan artefak model akhir untuk digunakan untuk penerapan model dan inferensi. Ada tindakan tambahan yang terlibat dalam fase setelah pelatihan seperti yang ditunjukkan pada diagram berikut.
-
Dapatkan model dasar: Setelah Anda memiliki artefak model, Anda dapat mengaturnya sebagai model dasar. Pertimbangkan tindakan pasca-pelatihan berikut dan menggunakan fitur SageMaker AI sebelum beralih ke penerapan model ke produksi.
-
Periksa kinerja model dan periksa bias: Gunakan Amazon CloudWatch Metrics dan Clarify SageMaker untuk bias pasca-pelatihan untuk mendeteksi bias apa pun dalam data dan model yang masuk dari waktu ke waktu terhadap baseline. Anda perlu mengevaluasi data baru dan prediksi model terhadap data baru secara teratur atau secara real time. Dengan menggunakan fitur-fitur ini, Anda dapat menerima peringatan tentang perubahan atau anomali akut, serta perubahan bertahap atau penyimpangan dalam data dan model.
-
Anda juga dapat menggunakan fungsionalitas Pelatihan Inkremental SageMaker AI untuk memuat dan memperbarui model Anda (atau menyempurnakan) dengan dataset yang diperluas.
-
Anda dapat mendaftarkan pelatihan model sebagai langkah dalam SageMaker AI Pipeline atau sebagai bagian dari fitur Workflow lain yang ditawarkan oleh SageMaker AI untuk mengatur siklus hidup ML penuh.