View a markdown version of this page

Mulai ulang node komputasi menggunakan Slurm di AWS PCS - AWS PCS

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Mulai ulang node komputasi menggunakan Slurm di AWS PCS

Gunakan perintah reboot asli Slurm untuk menyelesaikan masalah kinerja, menghapus masalah sumber daya, atau memulihkan dari status terdegradasi tanpa kehilangan kapasitas instans EC2.

Prasyarat

  • Hak istimewa Admin Slurm (akses pengguna root)

  • Akses ke node login di cluster AWS PCS

Prosedur

  1. Hubungkan ke node login melalui konsol EC2.

    1. Di konsol EC2, pilih Inst ans.

    2. Pilih instance simpul login Anda.

    3. Pilih Hubungkan.

  2. Identifikasi nama simpul komputasi target menggunakan sinfo atauscontrol show node.

    sinfo # or scontrol show node
  3. Jalankan perintah reboot menggunakan salah satu opsi ini:

    Awas

    Jangan gunakan nextstate=DOWN dengan scontrol reboot perintah. Parameter ini menandai node sebagai tidak sehat dan memicu penggantian instance.

    • Reboot dasar (menunggu node menjadi idle):

      scontrol reboot nodename
    • Segera reboot (menguras node dan reboot saat pekerjaan selesai):

      scontrol reboot ASAP nodename
    • Reboot dengan alasan:

      scontrol reboot ASAP reason="troubleshooting" nodename
    • Reboot dengan status resume:

      scontrol reboot ASAP nextstate=RESUME nodename
  4. Pantau kemajuan reboot menggunakanscontrol show node.

    scontrol show node nodename
  5. Verifikasi node kembali ke layanan setelah reboot selesai.