View a markdown version of this page

Memecahkan masalah di cluster dengan AWS Batch integrasi - AWS ParallelCluster

Terjemahan disediakan oleh mesin penerjemah. Jika konten terjemahan yang diberikan bertentangan dengan versi bahasa Inggris aslinya, utamakan versi bahasa Inggris.

Memecahkan masalah di cluster dengan AWS Batch integrasi

Bagian ini memberikan tips pemecahan masalah yang mungkin untuk cluster dengan integrasi AWS Batch penjadwal, khususnya dengan masalah node kepala, masalah komputasi, kegagalan pekerjaan, dan kesalahan batas waktu.

Masalah simpul kepala

Anda dapat memecahkan masalah pengaturan node kepala dengan cara yang sama seperti Slurm cluster (kecuali untuk log Slurm tertentu). Untuk informasi selengkapnya tentang masalah ini, lihatNode kepala.

Masalah komputasi

AWS Batch mengelola aspek penskalaan dan komputasi layanan Anda. Jika Anda mengalami masalah terkait komputasi, lihat dokumentasi pemec AWS Batch ahan masalah untuk bantuan.

Kegagalan pekerjaan

Jika pekerjaan gagal, Anda dapat menjalankan awsbout perintah untuk mengambil output pekerjaan. Anda juga dapat menjalankan awsbstat perintah untuk mendapatkan tautan ke log pekerjaan yang disimpan oleh Amazon CloudWatch.

Menghubungkan batas waktu pada kesalahan URL titik akhir

Jika pekerjaan paralel multi-node gagal dengan kesalahan:: Connect timeout on endpoint URL

  • Di log awsbout keluaran, periksa apakah pekerjaan tersebut paralel multi-node dari output: Detected 3/3 compute nodes. Waiting for all compute nodes to start.

  • Verifikasi apakah subnet node komputasi bersifat publik.

Multi-node pekerjaan paralel tidak mendukung penggunaan subnet publik saat menggunakan AWS Batch di AWS ParallelCluster. Gunakan subnet pribadi untuk node dan pekerjaan komputasi Anda. Untuk informasi selengkapnya, lihat Pertimbangan lingkungan komput asi di Panduan AWS Batch Pengguna. Untuk mengonfigurasi subnet pribadi untuk node komputasi Anda, lihat. AWS ParallelCluster dengan AWS Batch penjadwal