View a markdown version of this page

Cara kerja SageMaker penyaringan cerdas - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Cara kerja SageMaker penyaringan cerdas

Tujuan dari pen SageMaker yaringan cerdas adalah untuk menyaring data pelatihan Anda selama proses pelatihan dan hanya memberi sampel yang lebih informatif ke model. Selama pelatihan tipik PyTorch al dengan, data secara berulang dikirim dalam batch ke loop pelatihan dan ke perangkat akselerator (seperti GPU atau chip Trainium) oleh. PyTorch DataLoader SageMaker penyaringan cerdas diimplementasikan pada tahap pemuatan data ini dan dengan demikian tidak tergantung pada pra-pemrosesan data hulu apa pun dalam jalur pelatihan Anda. SageMaker penyaringan cerdas menggunakan model Anda dan fungsi kerugian yang ditentukan pengguna untuk melakukan penerusan maju evaluatif dari setiap sampel data saat dimuat. Sampel yang mengembalikan nilai kerugian rendah memiliki dampak yang lebih kecil pada pembelajaran model dan dengan demikian dikeluarkan dari pelatihan, karena sudah mudah bagi model untuk membuat prediksi yang tepat tentangnya dengan keyakinan tinggi. Sementara itu, sampel kehilangan yang relatif tinggi itulah yang masih perlu dipelajari model, jadi ini disimpan untuk pelatihan. Input kunci yang dapat Anda atur untuk peng SageMaker ayakan cerdas adalah proporsi data yang akan dikecualikan. Misalnya, dengan menetapkan proporsi menjadi 25%, sampel yang didistribusikan di kuartil terendah dari distribusi kerugian (diambil dari jumlah sampel sebelumnya yang ditentukan pengguna) dikeluarkan dari pelatihan. High-losssampel diakumulasikan dalam kumpulan data yang disempurnakan. Kumpulan data yang disempurnakan dikirim ke loop pelatihan (pass maju dan mundur), dan model belajar dan melatih kumpulan data yang disempurnakan.

Diagram berikut menunjukkan ikhtisar tentang bagaimana algoritma pengayak SageMaker pintar dirancang.

Diagram arsitektur tentang bagaimana SageMaker penyaringan cerdas beroperasi selama pelatihan saat data dimuat.

Singkatnya, pen SageMaker yaringan cerdas beroperasi selama pelatihan saat data dimuat. Algoritma penyaringan SageMaker cerdas menjalankan perhitungan kerugian pada batch, dan menyaring data yang tidak ditingkatkan sebelum lolos maju dan mundur dari setiap iterasi. Batch data yang disempurnakan kemudian digunakan untuk pass maju dan mundur.

catatan

Penyaringan data cerdas pada SageMaker AI menggunakan pass maju tambahan untuk menganalisis dan memfilter data pelatihan Anda. Pada gilirannya, ada lebih sedikit lintasan mundur karena data yang kurang berdampak dikeluarkan dari pekerjaan pelatihan Anda. Karena itu, model yang memiliki lintasan mundur panjang atau mahal melihat peningkatan efisiensi terbesar saat menggunakan pengayakan cerdas. Sementara itu, jika umpan maju model Anda membutuhkan waktu lebih lama daripada lintasan mundurnya, overhead dapat meningkatkan total waktu pelatihan. Untuk mengukur waktu yang dihabiskan oleh setiap pass, Anda dapat menjalankan pekerjaan pelatihan pilot dan mengumpulkan log yang mencatat waktu pada proses. Juga pertimbangkan untuk SageMaker menggunakan Profiler yang menyediakan alat pembuatan profil dan aplikasi UI. Untuk mempelajari selengkapnya, lihat SageMaker Profiler Amazon.

SageMaker penyaringan cerdas berfungsi untuk pekerjaan PyTorch-based pelatihan dengan paralelisme data terdistribusi klasik, yang membuat replika model pada setiap pekerja GPU dan kinerja. AllReduce Ia bekerja dengan PyTorch DDP dan perpustakaan paralel data terdistribusi SageMaker AI.