Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
Ich habe On-Demand-Kapazitätsreservierungen (ODCRs) oder zonale Reserved Instances konfiguriert
ODCRs, die Instanzen mit mehreren Netzwerkschnittstellen enthalten, wie P4d, P4de und AWS Trainium (Trn)
Überprüfen Sie in der Cluster-Konfigurationsdatei, ob sich der in einem öffentlichen Subnetz HeadNode befindet und ob sich die Rechenknoten in einem privaten Subnetz befinden.
ODCRs sind gezielte ODCRS
Die Datei '///run_instances_overrides.json' opt/slurm konnte nicht gelesen werden. etc/pclusterobwohl ich///run_instances_overrides.json bereits eingerichtet habe, indem ich den Anweisungen unter folge opt/slurm etc/pcluster Instances mit On-Demand Kapazitätsreservierungen (ODCR) starten
Wenn Sie die AWS ParallelCluster Versionen 3.1.1 bis 3.2.1 mit gezielten ODCRs verwenden und auch die JSON-Datei „Run Instances Override“ verwenden, ist es möglich, dass Sie die JSON-Datei nicht richtig formatiert haben. Möglicherweise wird ein Fehler wie der folgende angezeigtclustermgtd.log:
Unable to read file '/opt/slurm/etc/pcluster/run_instances_overrides.json'. Using default: {} in /var/log/parallelcluster/clustermgtd.
Überprüfen Sie, ob das JSON-Dateiformat korrekt ist, indem Sie Folgendes ausführen:
$echo /opt/slurm/etc/pcluster/run_instances_overrides.json | jq
Es wird angezeigt, dass RunInstances die Found-Parameter überschriebenin clustermgtd.log wenn die Clustererstellung fehlgeschlagen ist, oder in slurm_resume.log wenn die Ausführung des Jobs fehlgeschlagen ist
Wenn Sie die JSON-Datei „Run Instances Override“ verwenden, überprüfen Sie, ob Sie den Warteschlangennamen und den Namen der Rechenressourcen in der /opt/slurm/etc/pcluster/run_instances_overrides.json Datei korrekt festgelegt haben.
In slurm_resume.log ist ein Fehler aufgetreten (InsufficientInstanceCapacity), wenn ich einen Run-Job nicht ausführen kann, oder in clustermgtd.log, wenn ich keinen Cluster erstellen kann
slurm_resume.log ist ein Fehler aufgetreten (InsufficientInstanceCapacity),Verwenden von PG-ODCR (Placement Group ODCR)
Wenn Sie ein ODCR mit einer zugehörigen Platzierungsgruppe erstellen, muss derselbe Platzierungsgruppenname in der Konfigurationsdatei verwendet werden. Legen Sie den entsprechenden Platzierungsgruppennamen in der Cluster-Konfiguration fest.
Verwenden von zonalen Reserved Instances
Wenn Sie zonale Reserved Instances mitPlacementGroup/Enabledto true in der Cluster-Konfiguration verwenden, wird möglicherweise ein Fehler wie der folgende angezeigt:
We currently do not have sufficient trn1.32xlarge capacity in the Availability Zone you requested (us-east-1d). Our system will be working on provisioning additional capacity. You can currently get trn1.32xlarge capacity by not specifying an Availability Zone in your request or choosing us-east-1a, us-east-1b, us-east-1c, us-east-1e, us-east-1f.
Dies ist möglicherweise darauf zurückzuführen, dass die zonalen Reserved Instances nicht in derselben UC (oder Spine) platziert sind, was bei der Verwendung von Placement-Gruppen zu Fehlern bei unzureichender Kapazität (ICEs) führen kann. Sie können diesen Fall überprüfen, indem Sie die PlacementGroup Gruppeneinstellung in der Cluster-Konfiguration deaktivieren, um festzustellen, ob der Cluster die Instances zuweisen kann.