View a markdown version of this page

OpenTelemetry Referenz zu Metriken - Amazon SageMaker KI

Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.

OpenTelemetry Referenz zu Metriken

Dieser Abschnitt enthält eine umfassende (nicht erschöpfende) Liste von OpenTelemetry Metriken, die von Amazon SageMaker AI ausgegeben werden und detailliert beobachtbar sind und in SageMaker AI Insights verfügbar sind.

OpenTelemetry Metrik-Bezeichnungen

OpenTelemetry Zu den Metriken gehören Bezeichnungen (Attribute), die die jedem Datenpunkt zugeordnete Ressource identifizieren. Verwenden Sie diese Labels, um Metriken in Abfragen zu filtern und zu gruppieren.

OpenTelemetry beschriften Description
aws.sagemaker.endpoint.name Endpoint name (Endpunktname)
aws.sagemaker.variant.name Name der Produktionsvariante
aws.sagemaker.inference_component.name Name der Inferenzkomponente
@resource.host.id EC2-Instance-ID
aws.sagemaker.container.id Container-ID
@resource.cloud.availability_zone Availability Zone
@resource.host.type Instance-Typ

Account-level aggregierte Metriken

Diese Metriken befinden sich auf Kontoebene.

# Metrik Description
1 TotalEndpoints Gesamtzahl der aktiven Endpunkte im Konto
2 TotalICs Gesamtzahl der auf allen Endpunkten bereitgestellten Inferenzkomponenten
3 TotalInvocations Gesamtzahl der Inferenzanfragen auf allen Endpunkten

GPU-Metriken (DCGM)

Diese Metriken werden vom Data Center GPU Manager (DCGM) -Exporter erfasst und sind unabhängig vom Inferenz-Framework auf allen GPU-Endpunkten verfügbar.

Sie können auf Inferenzkomponenten-, Instanz- oder Endpunktebene aggregiert werden.

# Metrik Quellmetrik (en) Description
4 GPU-Auslastung (%) DCGM_FI_DEV_GPU_UTIL Prozentsatz der Zeit, in der die GPU Workloads aktiv ausgeführt hat
5 GPU-Speicherauslastung (%) DCGM_FI_DEV_MEM_COPY_UTIL Prozentsatz der Zeit, in der der Speichercontroller aktiv Daten in den oder aus dem GPU-Speicher verschoben hat

Metriken für Knoten (Instanz)

Diese Metriken werden vom Node Exporter erfasst und bieten Einblicke in die CPU-, Arbeitsspeicher- und Festplattenauslastung auf Instanzebene.

Sie können auf Instanz- oder Endpunktebene aggregiert werden.

# Metrik Quellmetrik (en) Description
6 CPU-Auslastung (%) node_cpu_seconds_total Ein kumulativer Zähler, der die gesamten CPU-Sekunden misst, die seit dem Start in jedem Ausführungsmodus (Leerlauf, Benutzer, System, Iowait) verbracht wurden. Leiten Sie den Prozentsatz der Auslastung aus der Rate im Leerlaufmodus ab.
7 Speicherauslastung (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes Prozentsatz des verwendeten physischen Speichers. Wird aus dem Gesamtspeicher abzüglich des verfügbaren Speichers abgeleitet.
8 Festplattenauslastung (%) node_filesystem_avail_bytes, node_filesystem_size_bytes Prozentsatz des belegten Dateisystemspeichers. Abgeleitet von der Gesamtgröße abzüglich des verfügbaren Speicherplatzes.

Metriken des Inferenz-Frameworks (vLLM/SGLang)

Inferenz-Framework-Metriken werden nativ von der Serving-Engine ausgegeben, die in Ihrem Modellcontainer läuft. SageMaker KI sammelt diese Metriken automatisch aus unterstützten Frameworks (vLLM und SGLang), wenn die detaillierte Beobachtbarkeit aktiviert ist. Diese Metriken bieten Einblick in Token-Durchsatz, Latenz, KV-Cache-Druck und Anforderungswarteschlangen auf der Ebene der Inferenzkomponenten.

Diese Metriken können auf Endpunkt-, Inferenzkomponenten- oder Instanzebene zugeordnet werden.

# Metrik Quellmetrik (en) Description
9 Eingabe-Tokens pro Sekunde vllm:prompt_tokens_total Gesamtzahl der pro Sekunde verarbeiteten Prompt-Token
10 Ausgabetokens pro Sekunde vllm:generation_tokens_total Gesamtzahl der generierten Token pro Sekunde
11 TPS insgesamt Abgeleitet von #9 + #10 Kombinierte Eingabe- und Ausgabetokens pro Sekunde
12 TPS-Auslastung% Abgeleitet von #11 Aktueller Token-Durchsatz als Prozentsatz des beobachteten Spitzenwerts
13 TTFT vllm:time_to_first_token_seconds Zeit vom Eingang der Anfrage bis zum ersten generierten Token (Histogramm)
14 Inter-Token Latenz vllm:inter_token_latency_seconds Durchschnittliche Zeit zwischen aufeinanderfolgenden generierten Tokens (Histogramm)
15 KV-Cache-Nutzung vllm:gpu_cache_usage_perc Prozentsatz des derzeit verwendeten KV-cache GPU-Speichers
16 Tiefe der Warteschlange vllm:num_requests_waiting Anzahl der Anfragen, die in der Warteschlange auf ihre Bearbeitung warten
17 Batch-Größe vllm:num_requests_running Anzahl der Anfragen, die derzeit ausgeführt werden (während der Bearbeitung)
18 Latenz modellieren vllm:e2e_request_latency_seconds End-to-end Latenz der Anfrage von der Ankunft bis zum endgültigen Token (Histogramm)
Anmerkung

Metriken mit dem Präfix vllm: haben äquivalente sglang: Gegenstücke für SGLang-Endpunkte.

Operations-driven Metriken

Diese Metriken sind ereignisgesteuert und werden von Ihren Vorgängen zum Erstellen, Aktualisieren oder Skalieren an einen Endpunkt oder eine Inferenzkomponente ausgegeben. Sie sind nicht betroffen von. MetricPublishFrequencyInSeconds

Diese Metriken können auf Endpunkt- und Inferenzkomponentenebene zugeordnet werden.

# Metrik Quellmetrik (en) Description
19 Skalierungsereignis e2e_duration Zeigt an, dass auf Ihrem Endpunkt eine auto-scaling oder manuelle Skalierungsaktion stattgefunden hat. Filtern Sie nach Bezeichnung aws.sagemaker.scaling.direction (ScaleOutoderScaleIn), um die Richtung zu identifizieren.
20 E2E-Skalierung, Latenz e2e_duration End-to-end Skalierungsdauer vom Auslöser bis zum Abschluss (Sekunden). Filtern Sie nach Bezeichnung aws.sagemaker.operation.type (z. B.UpdateWCEndpoint).
21 Anzahl der Eiswürfel ice_count Anzahl der Fehlerereignisse mit unzureichender Kapazität pro AZ und Instance-Typ
22 Ereignistyp beim Rebalancing rebalancing_blocked Art des Ausgleichsereignisses und sein aktueller Status
23 Dauer der Neugewichtung rebalancing_duration Dauer der Neugewichtung von Anfang bis Ende (Sekunden)
24 IC-Kopien wurden verschoben ic_copy_moved Anzahl der Kopien der Inferenzkomponenten, die beim Rebalancing verschoben wurden
25 Veröffentlichte Instanzen instances_released Anzahl der EC2-Instances, die durch die Konsolidierung beim Rebalancing freigegeben wurden
26 Dauer des Modell-Downloads model_download_time Zeit für das Herunterladen von Modellartefakten von S3 auf die Instanz (Sekunden)
27 Dauer des GPU-Ladevorgangs gpu_load_time Zeit bis zum Laden von Modellgewichten in den GPU-Speicher (Sekunden)
28 Startdauer des Containers container_start_time Zeit vom Start des Containers bis zum Bestehen der Integritätsprüfung (Sekunden)

Abgeleitete Kennzahlen zur Flottenplatzierung

Zusätzlich zu den oben aufgeführten Kennzahlen berechnet das SageMaker AI Insights-Dashboard abgeleitete Metriken aus Daten zur Platzierung der Kontrollebene. Dies sind aggregierte Ansichten, die auf dem Dashboard sichtbar sind, und es handelt sich nicht um einzeln abfragbare Metriknamen in Amazon CloudWatch Query Studio.

Zu den abgeleiteten Kennzahlen zur Flottenplatzierung gehören:

  • Anzahl der Instanzen pro Verfügbarkeitszone

  • Anzahl der IC-Kopien pro Verfügbarkeitszone

  • AZ-Schräglage (prozentualer Anteil des Verteilungsungleichgewichts in Ihrer Flotte)

  • IC-Kopien pro Instanz

Diese Werte sind auf der Registerkarte Zuverlässigkeit des SageMaker AI Insights-Dashboards sichtbar.