Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Cara kerja SageMaker penyaringan cerdas
Tujuan dari pen SageMaker yaringan cerdas adalah untuk menyaring data pelatihan Anda selama proses pelatihan dan hanya memberi sampel yang lebih informatif ke model. Selama pelatihan tipik PyTorch al dengan, data secara berulang dikirim dalam batch ke loop pelatihan dan ke perangkat akselerator (seperti GPU atau chip Trainium) oleh. PyTorch DataLoader
Diagram berikut menunjukkan ikhtisar tentang bagaimana algoritma pengayak SageMaker pintar dirancang.
Singkatnya, pen SageMaker yaringan cerdas beroperasi selama pelatihan saat data dimuat. Algoritma penyaringan SageMaker cerdas menjalankan perhitungan kerugian pada batch, dan menyaring data yang tidak ditingkatkan sebelum lolos maju dan mundur dari setiap iterasi. Batch data yang disempurnakan kemudian digunakan untuk pass maju dan mundur.
catatan
Penyaringan data cerdas pada SageMaker AI menggunakan pass maju tambahan untuk menganalisis dan memfilter data pelatihan Anda. Pada gilirannya, ada lebih sedikit lintasan mundur karena data yang kurang berdampak dikeluarkan dari pekerjaan pelatihan Anda. Karena itu, model yang memiliki lintasan mundur panjang atau mahal melihat peningkatan efisiensi terbesar saat menggunakan pengayakan cerdas. Sementara itu, jika umpan maju model Anda membutuhkan waktu lebih lama daripada lintasan mundurnya, overhead dapat meningkatkan total waktu pelatihan. Untuk mengukur waktu yang dihabiskan oleh setiap pass, Anda dapat menjalankan pekerjaan pelatihan pilot dan mengumpulkan log yang mencatat waktu pada proses. Juga pertimbangkan untuk SageMaker menggunakan Profiler yang menyediakan alat pembuatan profil dan aplikasi UI. Untuk mempelajari selengkapnya, lihat SageMaker Profiler Amazon.
SageMaker penyaringan cerdas berfungsi untuk pekerjaan PyTorch-based pelatihan dengan paralelisme data terdistribusi klasik, yang membuat replika model pada setiap pekerja GPU dan kinerja. AllReduce Ia bekerja dengan PyTorch DDP dan perpustakaan paralel data terdistribusi SageMaker AI.