View a markdown version of this page

Welche speziellen Konfigurationen werden in den Slurm-Konfigurationsdateien verwaltet HyperPod - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

Welche speziellen Konfigurationen werden in den Slurm-Konfigurationsdateien verwaltet HyperPod

Wenn Sie einen Slurm-Cluster erstellen HyperPod, richtet der HyperPod Agent die gres.conf Dateien slurm.conf und unter ein, /opt/slurm/etc/ um den Slurm-Cluster basierend auf Ihrer HyperPod Cluster-Erstellungsanforderung und den Lebenszyklus-Skripten zu verwalten. Die folgende Liste zeigt, welche spezifischen Parameter der HyperPod Agent verarbeitet und überschreibt.

Wichtig

Es wird dringend empfohlen, diese Parameter, die von HyperPod verwaltet werden, nicht zu ändern.

  • slurm.confIn HyperPod richtet die folgenden grundlegenden Parameter ein: ClusterName SlurmctldHostPartitionName, undNodeName.

    Um die Automatische Knotenwiederherstellung und automatische Wiederaufnahme Funktionalität zu aktivieren, HyperPod müssen die SchedulerParameters Parameter TaskPlugin und außerdem wie folgt festgelegt werden. Der HyperPod Agent richtet diese beiden Parameter standardmäßig mit den erforderlichen Werten ein.

    TaskPlugin=task/none SchedulerParameters=permit_job_expansion
  • In gres.conf, HyperPod verwaltet NodeName für GPU-Knoten.