Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.
Instans EC2 di AWS PCS dihentikan dan diganti setelah reboot
Ikhtisar masalah
Setelah instance EC2 dalam grup simpul komputasi di-boot ulang, AWS PCS secara otomatis mengakhiri dan mengganti instance.
Mengapa ini terjadi
AWS PCS tidak mendukung reboot instance. Jika instance EC2 di-boot ulang, AWS PCS menganggap instance tidak sehat dan menggantikannya. Jika AWS PCS terus-menerus menghentikan dan mengganti instance Anda, itu mungkin karena ada sesuatu yang me-reboot instance Anda setelah diluncurkan. Beberapa contoh termasuk reboot dengan otomatisasi pada instance EC2 (seperti reboot otomatis setelah patch), otomatisasi eksternal ke instans EC2 (seperti aplikasi manajemen jaringan), AWS layanan lain (seperti AWS Systems Manager), atau reboot manual oleh seseorang.
Apa yang harus dilakukan
Anda dapat memeriksa slurmd log slurmctld atau untuk melihat apakah instans Anda di-boot ulang. Untuk informasi selengkapnya, lihat Log penjadwal di AWS PCS dan Memantau AWS Instans PCS menggunakan Amazon CloudWatch. Contoh entri slurmctld log berikut menunjukkan bahwa instance di-boot ulang:
contoh
[2024-09-12T06:42:50.393+00:00] validate_node_specs: Node Login-1 unexpectedly rebooted boot_time=1726123354 last response=1726123285Mem-boot ulang karena tambalan
Reboot sering diperlukan setelah Anda menerapkan patch. Jangan menerapkan patch langsung ke instans EC2 yang merupakan bagian dari grup simpul kom AWS putasi PCS. Jika Anda harus menambal instans EC2, Anda harus menerapkan patch ke Amazon Machine Image (AMI) yang diperbarui dan memperbarui grup simpul komputasi Anda untuk menggunakan AMI yang diperbarui. Instans EC2 baru yang dil AWS uncurkan PCS untuk grup simpul komputasi tersebut akan menggunakan AMI yang diperbarui (ditambal). Untuk informasi selengkapnya, lihat Gambar Mesin Amazon Kustom (AMIs) untuk AWS PCS.