View a markdown version of this page

SageMaker HyperPod EKS-Cluster-Ereignisse - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

SageMaker HyperPod EKS-Cluster-Ereignisse

Amazon SageMaker HyperPod sendet strukturierte Cluster-Ereignisse aus, die Einblick in betriebliche Änderungen auf Cluster-, Instanzgruppen- und Instance-Ebene bieten. Sie können diese Ereignisse verwenden, um die Bereitstellungsaktivitäten zu überwachen, Skalierungsvorgänge zu verfolgen, Fehler zu erkennen und automatische Warnleitungen aufzubauen.

Cluster-Ereignisse sind für HyperPod EKS-Cluster mit NodeProvisioningMode der Einstellung auf verfügbar. Continuous Auf Ereignisse kann über die ListClusterEvents DescribeClusterEvent AND-APIs, die SageMaker AI-Konsole und Amazon zugegriffen EventBridge werden.

Das vollständige Eventschema, die Schweregrade, den vollständigen Event-Katalog und Einzelheiten EventBridge zur Integration finden Sie unterSageMaker HyperPod Referenz zu Cluster-Ereignissen.

Voraussetzungen

  • Ihr HyperPod EKS-Cluster muss auf NodeProvisioningMode eingestellt seinContinuous. Cluster, die den Legacy-Bereitstellungsmodus verwenden, geben keine strukturierten Ereignisse aus.

  • Um die API verwenden zu können, benötigen sagemaker:ListClusterEvents Sie die sagemaker:DescribeClusterEvent entsprechenden Berechtigungen in Ihrer IAM-Richtlinie.

Event types (Ereignistypen)

HyperPod gibt bei kontinuierlicher Bereitstellung zwei Kategorien von Ereignissen für EKS-Cluster aus: allgemeine Ereignisse, die für alle Orchestratoren gelten, und Ereignisse. EKS-specific

Zu den häufigsten Ereignissen gehören Kerninfrastrukturvorgänge wie die Bereitstellung und Beendigung von Instanzen, die Skalierung von Instanzgruppen, die Bearbeitung von Kapazitätsreservierungen, die Ausführung von Lebenszyklus-Skripten, das ENI-Management, der Lebenszyklus des FSx-Dateisystems und Patching-Workflows. Die vollständige Liste finden Sie Häufige Ereignisse (EKS und Slurm) in der Referenz zu Cluster-Ereignissen. HyperPod

EKS-specific Zu den Ereignissen gehören orchestratorspezifische Operationen wie EKS-Zugriffsverwaltung, Kubernetes-Konfigurationsupdates (Labels und Taints), der Karpenter Autoscaling-Lebenszyklus, das Entfernen von Pods und während des Patchens sowie die Überwachung von Bake-Time-Alarmen mit automatischem Rollback. cordon/uncordon Diese Ereignisse bieten Einblick in Lebenszyklusphasen, die zuvor nur anhand von Protokollen beobachtet werden konnten. EKS-specific CloudWatch Die vollständige Liste finden Sie EKS-specific Ereignisse in der Referenz zu HyperPod Clusterereignissen.

Ereignisse in der Konsole anzeigen

  1. Öffnen Sie die SageMaker AI-Konsole.

  2. Wählen Sie im linken Navigationsbereich HyperPod Cluster aus.

  3. Wählen Sie Ihren Cluster-Namen.

  4. Wählen Sie die Registerkarte Ereignisse .

Auf der Registerkarte Ereignisse wird eine paginierte Liste von Ereignissen mit Spalten für die Ereignisebene, die Ereignis-ID, den Ressourcennamen, den Ressourcentyp, die Beschreibung und die Uhrzeit des Ereignisses angezeigt. Sie können Ereignisse mithilfe des Suchfelds nach Attributen filtern, nach Veranstaltungszeit sortieren und eine Ereignis-ID auswählen, um vollständige Veranstaltungsdetails einschließlich der Veranstaltungsmetadaten und des vollständigen Ereignisdatensatzes anzuzeigen.

Auflisten von Ereignissen mithilfe der AWS CLI

Verwenden Sie den list-cluster-events Befehl, um Ereignisse für Ihren Cluster abzurufen:

aws sagemaker list-cluster-events \ --cluster-name my-eks-cluster \ --sort-by EventTime \ --sort-order Descending \ --max-results 20

Sie können die Ergebnisse mithilfe der folgenden Filter eingrenzen:

  • --resource-type— filtern nach ClusterInstanceGroup, oderInstance.

  • --instance-group-name— nach Ereignissen für eine bestimmte Instanzgruppe filtern.

  • --node-id— nach Ereignissen für eine bestimmte EC2-Instance filtern.

  • --event-time-afterund --event-time-before — nach einem bestimmten Zeitfenster filtern.

Um beispielsweise nur Ereignisse auf Instanzgruppenebene für eine bestimmte Instanzgruppe zu sehen:

aws sagemaker list-cluster-events \ --cluster-name my-eks-cluster \ --resource-type InstanceGroup \ --instance-group-name gpu-workers

Beschreibung eines bestimmten Ereignisses

Verwenden Sie den describe-cluster-event Befehl mit einer Ereignis-ID aus der Listenausgabe, um vollständige Ereignisdetails abzurufen, einschließlich der EventLevelDescription, undEventMetadata:

aws sagemaker describe-cluster-event \ --cluster-name my-eks-cluster \ --event-id 83ea0bb5-be77-45e8-a458-0a87f778a205

Die Struktur des zurückgegebenen Ereignisdatensatzes und eine Beschreibung der einzelnen Felder finden Sie Cluster-Ereignisaufzeichnung in der HyperPod Cluster-Ereignisreferenz.

Automatisieren von Antworten mit Amazon EventBridge

HyperPod Cluster-Ereignisse werden automatisch EventBridge unter dem Detailtyp an Amazon gesendetSageMaker HyperPod Cluster Event, sodass Sie Ereignisse an Ziele wie Lambda, Amazon SNS, Step Functions oder Amazon SQS weiterleiten können. Sie können nach dem EventLevel Feld filtern, um nur Warnungen für Error Ereignisse auszulösen, oder nach Cluster-ARN filtern, um Regeln auf einen bestimmten Cluster festzulegen.

EventBridge Ereignismuster, Beispiele für Nutzdaten sowie die zugehörigen Typen SageMaker HyperPod Cluster State Change und SageMaker HyperPod Cluster Node Health Event detaillierte Typen finden Sie EventBridge Integration in der HyperPod Cluster-Ereignisreferenz.