View a markdown version of this page

Perubahan ketersediaan debugger - Amazon SageMaker AI

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Perubahan ketersediaan debugger

catatan

Amazon SageMaker Debugger tidak lagi terbuka untuk pelanggan baru. Pelanggan yang sudah ada dapat terus menggunakan layanan seperti biasa. AWS terus berinvestasi dalam peningkatan keamanan dan ketersediaan untuk Debugger, tetapi kami tidak berencana untuk memperkenalkan fitur baru.

Mengganti Amazon SageMaker Debugger

Ikuti panduan ini untuk beralih ke layanan alternatif.

Gambaran umum

Amazon SageMaker Debugger menyediakan observabilitas pelatihan, debugging model, dan pembuatan profil sistem sebagai kemampuan bawaan SageMaker . Kemampuan ini sekarang lebih baik dilayani oleh kombinasi Amazon SageMaker AI MLFlow, TensorBoard on SageMaker, dan Amazon CloudWatch untuk melatih observabilitas, debugging model, dan pemantauan kinerja sistem. Alat ini menyediakan kemampuan fleksibel yang disesuaikan dengan alur kerja pelatihan spesifik Anda, baik Anda menyempurnakan model dasar, melatih arsitektur khusus, atau menjalankan beban kerja terdistribusi.

Pemetaan kemampuan

Kemampuan debugger Diganti oleh Apa yang disediakannya
Pencatatan metrik pelatihan MLaliran/ TensorBoard Catat, visualisasikan, dan bandingkan metrik di seluruh proses pelatihan
Pelacakan model dan parameter MLFlow Lacak hyperparameter, versi model, dan artefak dengan reproduktifitas penuh
Analisis gradien, aktivasi, dan berat TensorBoard Plugin histogram dan distribusi untuk memeriksa internal model di seluruh langkah pelatihan
Profil sumber daya sistem (CPU, GPU, memori, disk) Amazon CloudWatch Real-time metrik pemanfaatan dengan dasbor yang dapat dikonfigurasi
Diagnostik pelatihan otomatis CloudWatch Alarm Amazon+MLFlow Pantau metrik yang dicatat seperti konvergensi kerugian, norma gradien, pemanfaatan sumber daya, dan peringatan tentang pelanggaran ambang batas. Perbandingan run MLFlow mengidentifikasi regresi di seluruh eksperimen

Langkah 1: Menghapus konfigurasi Debugger

Hapus DebuggerHookConfig dari estimator Anda

Jika skrip atau SageMaker estimator pelatihan Anda menyer DebuggerHookConfig takan Debugger-specific TensorBoardOutputConfig,, atau rules konfigurasi, hapus. Ini menonaktifkan penangkapan tensor otomatis dan evaluasi aturan.

catatan

Jika Anda menggunakan Estimator kelas SageMaker Python SDK v2, pertimbangkan juga untuk beralih ke API pelatihan SageMaker Python SDK yang lebih baru atau CreateTrainingJob panggilan Boto3 langsung, karena Estimator adalah konstruksi lama.

Hapus keluaran Debugger di Amazon S3

Debugger menyimpan data tensor dan output profil di S3 di bawah jalur seperti:

s3://<bucket>/<training-job-name>/debug-output/ s3://<bucket>/<training-job-name>/profiler-output/

Hapus awalan ini jika Anda tidak lagi membutuhkan data historis. Log pekerjaan pelatihan Anda dan artefak model di S3 tetap tidak terpengaruh.

Hapus aturan Debugger khusus (jika digunakan)

Jika Anda mendefinisikan wadah aturan khusus:

  • Hapus gambar Amazon ECR yang digunakan untuk evaluasi aturan Debugger khusus

  • Hapus skrip definisi aturan atau konfigurasi JSON yang tidak lagi diperlukan

Hapus CloudWatch grup log (opsional)

Debugger membuat grup log di bawah /aws/sagemaker/TrainingJobs untuk evaluasi aturan. Hapus ini jika tidak lagi diperlukan untuk mengurangi biaya penyimpanan log.

Tinjau kebijakan IAM

Hapus kebijakan IAM yang memberikan akses khusus untuk penggunaan Debugger:

  • s3:GetObject/dic s3:PutObject akup ke jalur keluaran Debugger

  • logs:PutLogEventsuntuk Debugger-specific grup log

  • Izin untuk eksekusi wadah aturan Debugger

Pertahankan kebijakan apa pun yang masih diperlukan untuk pekerjaan pelatihan Anda, MLFlow, atau CloudWatch.

Langkah 2: Mengkonfigurasi penggantian

Integrasikan MLFlow untuk pelacakan eksperimen

Amazon SageMaker AI menawarkan kemampuan MLFlow tanpa server yang dinilai secara dinamis untuk mendukung tugas pengembangan model AI tanpa biaya tambahan. Lihat blog pel uncuran.

Gunakan MLFlow untuk:

  • Log hyperparameter, metrik pelatihan, dan artefak model

  • Bandingkan proses berdampingan untuk mengidentifikasi regresi atau peningkatan

  • Lacak versi model dan garis keturunan dari percobaan hingga produksi

Memulai: Eksper imen pembelajaran mesin menggunakan Amazon SageMaker AI dengan MLFlow — mencakup penyiapan, membuat server pelacakan, dan mengintegrasikan dengan kode pelatihan Anda.

Gunakan TensorBoard untuk introspeksi model

TensorBoard di Amazon SageMaker AI memberikan visibilitas mendalam ke internal model selama pelatihan:

  • Visualisasikan distribusi gradien dan histogram berat di seluruh langkah

  • Memantau pola aktivasi dan perilaku lapisan

  • Melacak metrik skalar, gambar, dan visualisasi khusus

Kapan menggunakan TensorBoard vs. MLFlow: MLFlow melacak metrik skalar dan mendukung visualisasi dasar untuk menjalankan perbandingan. TensorBoard unggul dalam introspeksi model multi-dimensi — histogram gradien, distribusi bobot, grafik komputasi, dan proyeksi penyematan. Gunakan keduanya bersama-sama: MLFlow untuk manajemen eksperimen, TensorBoard untuk sesi debugging yang mendalam.

Memulai: TensorBoard di Amazon SageMaker AI

Gunakan Amazon CloudWatch untuk pemantauan dan peringatan sistem

Amazon CloudWatch menangkap metrik pemanfaatan sumber daya untuk pekerjaan pelatihan Anda dan mendukung alarm yang dapat dikonfigurasi:

  • Memantau CPU, GPU, memori, dan pemanfaatan disk secara real time

  • Atur alarm pada metrik pelatihan apa pun untuk mendeteksi anomali — dataran tinggi kehilangan, hambatan sumber daya, atau perilaku metrik yang tidak terduga

  • Buat dasbor yang menggabungkan metrik sistem dan metrik pelatihan untuk visibilitas terpadu

Memulai: CloudWatch Metrik Amazon untuk Memantau dan Menganalisis Pekerjaan Pelatihan

Apa yang terjadi pada data Anda yang ada

  • Log pelatihan di S3: Output pekerjaan pelatihan Anda, artefak model, dan log tetap dapat diakses. Ini independen dari Debugger.

  • Data tensor debugger: Koleksi tensor historis yang disimpan oleh Debugger tetap di S3 di jalur yang tercantum di atas sampai Anda menghapusnya. Perpustakaan smdebug klien masih dapat membaca data ini untuk referensi.

  • CloudWatch metrik: Metrik pelatihan historis yang sudah CloudWatch ada disimpan sesuai pengaturan retensi log akun Anda.