View a markdown version of this page

Mem-boot ulang node komputasi dengan Slurm di AWS PCS - AWS PCS

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mem-boot ulang node komputasi dengan Slurm di AWS PCS

AWS PCS mendukung perintah asli scontrol reboot Slurm. Gunakan perintah ini untuk me-reboot node komputasi tanpa penggantian instance EC2. Metode reboot lainnya (konsol Amazon EC2, patch otomatis AWS CLI, atau pemeliharaan sistem) menyebabkan AWS PCS menganggap instance EC2 tidak sehat dan menggantinya.

Manfaat reboot Slurm

Slurm reboot memberikan beberapa keuntungan untuk pemeliharaan cluster:

  • Pertahankan kapasitas — Hindari kehilangan instans EC2 yang dibatasi kapasitas ke pelanggan lain.

  • Mengurangi biaya — Hilangkan siklus penggantian instans yang tidak perlu dan penagihan lanjutan untuk node idle.

  • Pemulihan lebih cepat — Tidak ada penundaan penyediaan dibandingkan dengan penggantian instans.

  • Fleksibilitas operasional — Menghapus kebocoran memori, menghapus file sementara, dan memulihkan node dari status terdegradasi.

Kapan menggunakan Slurm reboot

Gunakan reboot Slurm untuk skenario pemeliharaan operasional umum:

  • Pemec ahan masalah — Menyelesaikan masalah kinerja atau proses yang tidak responsif, terutama untuk node GPU.

  • Pembersihan sumber daya — Menghapus kebocoran memori, file sementara/tmp, atau proses macet yang memengaruhi kinerja pekerjaan.

  • Pemulihan — Memulihkan node dari keadaan hangus atau terdegradasi sebelum memerlukan penggantian node penuh.

Batasan

  • Hanya pengguna Admin Slurm (pengguna root) yang dapat menjalankan perintah reboot.

  • Dukungan reboot terbatas scontrol reboot hanya.

  • RebootProgram konfigurasi tidak didukung.

  • Tidak ada antarmuka konsol — hanya baris perintah.