View a markdown version of this page

SageMaker HyperPod Slurm-Cluster-Ereignisse - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker HyperPod Slurm-Cluster-Ereignisse

Amazon SageMaker HyperPod sendet strukturierte Cluster-Ereignisse aus, die Einblick in betriebliche Änderungen auf Cluster-, Instanzgruppen- und Instance-Ebene bieten. Sie können diese Ereignisse verwenden, um die Bereitstellungsaktivitäten zu überwachen, Skalierungsvorgänge zu verfolgen, Fehler zu erkennen und automatische Warnleitungen aufzubauen.

Cluster-Ereignisse sind für HyperPod Slurm-Cluster mit dem NodeProvisioningMode Wert auf Continuous verfügbar. Auf Ereignisse kann über die ListClusterEvents DescribeClusterEvent AND-APIs, die SageMaker KI-Konsole und Amazon EventBridge zugegriffen werden.

Das vollständige Eventschema, die Schweregrade, den vollständigen Event-Katalog und Einzelheiten EventBridge zur Integration finden Sie unterSageMaker HyperPod Referenz zu Cluster-Ereignissen.

Voraussetzungen

  • Ihr HyperPod Slurm-Cluster muss auf NodeProvisioningMode eingestellt seinContinuous. Cluster, die den Legacy-Bereitstellungsmodus verwenden, geben keine strukturierten Ereignisse aus.

  • Um die API verwenden zu können, benötigen sagemaker:ListClusterEvents Sie die sagemaker:DescribeClusterEvent entsprechenden Berechtigungen in Ihrer IAM-Richtlinie.

Event types (Ereignistypen)

HyperPod gibt bei kontinuierlicher Bereitstellung zwei Kategorien von Ereignissen für Slurm-Cluster aus: allgemeine Ereignisse, die für alle Orchestratoren gelten, und Ereignisse. Slurm-specific

Zu den häufigsten Ereignissen gehören Kerninfrastrukturvorgänge wie die Bereitstellung und Beendigung von Instanzen, die Skalierung von Instanzgruppen, die Bearbeitung von Kapazitätsreservierungen, die Ausführung von Lebenszyklus-Skripten, das ENI-Management, der Lebenszyklus des FSx-Dateisystems und Patching-Workflows. Die vollständige Liste finden Sie Häufige Ereignisse (EKS und Slurm) in der Referenz zu Cluster-Ereignissen. HyperPod

Slurm-specific Ereignisse umfassen orchestratorspezifische Operationen wie die Validierung von Bereitstellungsparametern, die Erstellung von Munge-Schlüsseln, die Erkennung von Slurm-Konfigurationsabweichungen, die Slurm-Rekonfiguration und das Cluster-Rollback. Diese Ereignisse bieten Einblick in Slurm-specific Lebenszyklusphasen, die zuvor nur anhand von Protokollen beobachtet werden konnten. CloudWatch Die vollständige Liste finden Sie Slurm-specific Ereignisse in der Referenz zu HyperPod Clusterereignissen.

Ereignisse in der Konsole anzeigen

  1. Öffnen Sie die SageMaker AI-Konsole.

  2. Wählen Sie im linken Navigationsbereich HyperPod Cluster aus.

  3. Wählen Sie Ihren Cluster-Namen.

  4. Wählen Sie die Registerkarte Ereignisse .

Auf der Registerkarte Ereignisse wird eine paginierte Liste von Ereignissen mit Spalten für die Ereignisebene, die Ereignis-ID, den Ressourcennamen, den Ressourcentyp, die Beschreibung und die Uhrzeit des Ereignisses angezeigt. Sie können Ereignisse mithilfe des Suchfelds nach Attributen filtern, nach Veranstaltungszeit sortieren und eine Ereignis-ID auswählen, um vollständige Veranstaltungsdetails einschließlich der Veranstaltungsmetadaten und des vollständigen Ereignisdatensatzes anzuzeigen.

Auflisten von Ereignissen mithilfe der AWS CLI

Verwenden Sie den list-cluster-events Befehl, um Ereignisse für Ihren Cluster abzurufen:

aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20

Sie können die Ergebnisse mithilfe der folgenden Filter eingrenzen:

  • --resource-type— filtern nach ClusterInstanceGroup, oderInstance.

  • --instance-group-name— nach Ereignissen für eine bestimmte Instanzgruppe filtern.

  • --node-id— nach Ereignissen für eine bestimmte EC2-Instance filtern.

  • --event-time-afterund --event-time-before — nach einem bestimmten Zeitfenster filtern.

Um beispielsweise nur Ereignisse auf Instanzgruppenebene für eine bestimmte Instanzgruppe zu sehen:

aws sagemaker list-cluster-events \ --cluster-name my-slurm-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers

Beschreibung eines bestimmten Ereignisses

Verwenden Sie den describe-cluster-event Befehl mit einer Ereignis-ID aus der Listenausgabe, um vollständige Ereignisdetails abzurufen, einschließlich der EventLevelDescription, undEventMetadata:

aws sagemaker describe-cluster-event \ --cluster-name my-slurm-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205

Die Struktur des zurückgegebenen Ereignisdatensatzes und eine Beschreibung der einzelnen Felder finden Sie Cluster-Ereignisaufzeichnung in der HyperPod Cluster-Ereignisreferenz.

Automatisieren von Antworten mit Amazon EventBridge

HyperPod Cluster-Ereignisse werden automatisch EventBridge unter dem Detailtyp an Amazon gesendetSageMaker HyperPod Cluster Event, sodass Sie Ereignisse an Ziele wie Lambda, Amazon SNS, Step Functions oder Amazon SQS weiterleiten können. Sie können nach dem EventLevel Feld filtern, um nur Warnungen für Error Ereignisse auszulösen, oder nach Cluster-ARN filtern, um Regeln auf einen bestimmten Cluster festzulegen.

EventBridge Ereignismuster, Beispiele für Nutzdaten sowie die zugehörigen Typen SageMaker HyperPod Cluster State Change und SageMaker HyperPod Cluster Node Health Event detaillierte Typen finden Sie EventBridge Integration in der HyperPod Cluster-Ereignisreferenz.