Die vorliegende Übersetzung wurde maschinell erstellt. Im Falle eines Konflikts oder eines Widerspruchs zwischen dieser übersetzten Fassung und der englischen Fassung (einschließlich infolge von Verzögerungen bei der Übersetzung) ist die englische Fassung maßgeblich.
OpenTelemetry Referenz zu Metriken
Dieser Abschnitt enthält eine umfassende (nicht erschöpfende) Liste von OpenTelemetry Metriken, die von Amazon SageMaker AI ausgegeben werden und detailliert beobachtbar sind und in SageMaker AI Insights verfügbar sind.
OpenTelemetry Metrik-Bezeichnungen
OpenTelemetry Zu den Metriken gehören Bezeichnungen (Attribute), die die jedem Datenpunkt zugeordnete Ressource identifizieren. Verwenden Sie diese Labels, um Metriken in Abfragen zu filtern und zu gruppieren.
| OpenTelemetry beschriften | Description |
|---|---|
aws.sagemaker.endpoint.name |
Endpoint name (Endpunktname) |
aws.sagemaker.variant.name |
Name der Produktionsvariante |
aws.sagemaker.inference_component.name |
Name der Inferenzkomponente |
@resource.host.id |
EC2-Instance-ID |
aws.sagemaker.container.id |
Container-ID |
@resource.cloud.availability_zone |
Availability Zone |
@resource.host.type |
Instance-Typ |
Account-level aggregierte Metriken
Diese Metriken befinden sich auf Kontoebene.
| # | Metrik | Description |
|---|---|---|
| 1 | TotalEndpoints |
Gesamtzahl der aktiven Endpunkte im Konto |
| 2 | TotalICs |
Gesamtzahl der auf allen Endpunkten bereitgestellten Inferenzkomponenten |
| 3 | TotalInvocations |
Gesamtzahl der Inferenzanfragen auf allen Endpunkten |
GPU-Metriken (DCGM)
Diese Metriken werden vom Data Center GPU Manager (DCGM) -Exporter erfasst und sind unabhängig vom Inferenz-Framework auf allen GPU-Endpunkten verfügbar.
Sie können auf Inferenzkomponenten-, Instanz- oder Endpunktebene aggregiert werden.
| # | Metrik | Quellmetrik (en) | Description |
|---|---|---|---|
| 4 | GPU-Auslastung (%) | DCGM_FI_DEV_GPU_UTIL |
Prozentsatz der Zeit, in der die GPU Workloads aktiv ausgeführt hat |
| 5 | GPU-Speicherauslastung (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
Prozentsatz der Zeit, in der der Speichercontroller aktiv Daten in den oder aus dem GPU-Speicher verschoben hat |
Metriken für Knoten (Instanz)
Diese Metriken werden vom Node Exporter erfasst und bieten Einblicke in die CPU-, Arbeitsspeicher- und Festplattenauslastung auf Instanzebene.
Sie können auf Instanz- oder Endpunktebene aggregiert werden.
| # | Metrik | Quellmetrik (en) | Description |
|---|---|---|---|
| 6 | CPU-Auslastung (%) | node_cpu_seconds_total |
Ein kumulativer Zähler, der die gesamten CPU-Sekunden misst, die seit dem Start in jedem Ausführungsmodus (Leerlauf, Benutzer, System, Iowait) verbracht wurden. Leiten Sie den Prozentsatz der Auslastung aus der Rate im Leerlaufmodus ab. |
| 7 | Speicherauslastung (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
Prozentsatz des verwendeten physischen Speichers. Wird aus dem Gesamtspeicher abzüglich des verfügbaren Speichers abgeleitet. |
| 8 | Festplattenauslastung (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
Prozentsatz des belegten Dateisystemspeichers. Abgeleitet von der Gesamtgröße abzüglich des verfügbaren Speicherplatzes. |
Metriken des Inferenz-Frameworks (vLLM/SGLang)
Inferenz-Framework-Metriken werden nativ von der Serving-Engine ausgegeben, die in Ihrem Modellcontainer läuft. SageMaker KI sammelt diese Metriken automatisch aus unterstützten Frameworks (vLLM und SGLang), wenn die detaillierte Beobachtbarkeit aktiviert ist. Diese Metriken bieten Einblick in Token-Durchsatz, Latenz, KV-Cache-Druck und Anforderungswarteschlangen auf der Ebene der Inferenzkomponenten.
Diese Metriken können auf Endpunkt-, Inferenzkomponenten- oder Instanzebene zugeordnet werden.
| # | Metrik | Quellmetrik (en) | Description |
|---|---|---|---|
| 9 | Eingabe-Tokens pro Sekunde | vllm:prompt_tokens_total |
Gesamtzahl der pro Sekunde verarbeiteten Prompt-Token |
| 10 | Ausgabetokens pro Sekunde | vllm:generation_tokens_total |
Gesamtzahl der generierten Token pro Sekunde |
| 11 | TPS insgesamt | Abgeleitet von #9 + #10 | Kombinierte Eingabe- und Ausgabetokens pro Sekunde |
| 12 | TPS-Auslastung% | Abgeleitet von #11 | Aktueller Token-Durchsatz als Prozentsatz des beobachteten Spitzenwerts |
| 13 | TTFT | vllm:time_to_first_token_seconds |
Zeit vom Eingang der Anfrage bis zum ersten generierten Token (Histogramm) |
| 14 | Inter-Token Latenz | vllm:inter_token_latency_seconds |
Durchschnittliche Zeit zwischen aufeinanderfolgenden generierten Tokens (Histogramm) |
| 15 | KV-Cache-Nutzung | vllm:gpu_cache_usage_perc |
Prozentsatz des derzeit verwendeten KV-cache GPU-Speichers |
| 16 | Tiefe der Warteschlange | vllm:num_requests_waiting |
Anzahl der Anfragen, die in der Warteschlange auf ihre Bearbeitung warten |
| 17 | Batch-Größe | vllm:num_requests_running |
Anzahl der Anfragen, die derzeit ausgeführt werden (während der Bearbeitung) |
| 18 | Latenz modellieren | vllm:e2e_request_latency_seconds |
End-to-end Latenz der Anfrage von der Ankunft bis zum endgültigen Token (Histogramm) |
Anmerkung
Metriken mit dem Präfix vllm: haben äquivalente sglang: Gegenstücke für SGLang-Endpunkte.
Operations-driven Metriken
Diese Metriken sind ereignisgesteuert und werden von Ihren Vorgängen zum Erstellen, Aktualisieren oder Skalieren an einen Endpunkt oder eine Inferenzkomponente ausgegeben. Sie sind nicht betroffen von. MetricPublishFrequencyInSeconds
Diese Metriken können auf Endpunkt- und Inferenzkomponentenebene zugeordnet werden.
| # | Metrik | Quellmetrik (en) | Description |
|---|---|---|---|
| 19 | Skalierungsereignis | e2e_duration |
Zeigt an, dass auf Ihrem Endpunkt eine auto-scaling oder manuelle Skalierungsaktion stattgefunden hat. Filtern Sie nach Bezeichnung aws.sagemaker.scaling.direction (ScaleOutoderScaleIn), um die Richtung zu identifizieren. |
| 20 | E2E-Skalierung, Latenz | e2e_duration |
End-to-end Skalierungsdauer vom Auslöser bis zum Abschluss (Sekunden). Filtern Sie nach Bezeichnung aws.sagemaker.operation.type (z. B.UpdateWCEndpoint). |
| 21 | Anzahl der Eiswürfel | ice_count |
Anzahl der Fehlerereignisse mit unzureichender Kapazität pro AZ und Instance-Typ |
| 22 | Ereignistyp beim Rebalancing | rebalancing_blocked |
Art des Ausgleichsereignisses und sein aktueller Status |
| 23 | Dauer der Neugewichtung | rebalancing_duration |
Dauer der Neugewichtung von Anfang bis Ende (Sekunden) |
| 24 | IC-Kopien wurden verschoben | ic_copy_moved |
Anzahl der Kopien der Inferenzkomponenten, die beim Rebalancing verschoben wurden |
| 25 | Veröffentlichte Instanzen | instances_released |
Anzahl der EC2-Instances, die durch die Konsolidierung beim Rebalancing freigegeben wurden |
| 26 | Dauer des Modell-Downloads | model_download_time |
Zeit für das Herunterladen von Modellartefakten von S3 auf die Instanz (Sekunden) |
| 27 | Dauer des GPU-Ladevorgangs | gpu_load_time |
Zeit bis zum Laden von Modellgewichten in den GPU-Speicher (Sekunden) |
| 28 | Startdauer des Containers | container_start_time |
Zeit vom Start des Containers bis zum Bestehen der Integritätsprüfung (Sekunden) |
Abgeleitete Kennzahlen zur Flottenplatzierung
Zusätzlich zu den oben aufgeführten Kennzahlen berechnet das SageMaker AI Insights-Dashboard abgeleitete Metriken aus Daten zur Platzierung der Kontrollebene. Dies sind aggregierte Ansichten, die auf dem Dashboard sichtbar sind, und es handelt sich nicht um einzeln abfragbare Metriknamen in Amazon CloudWatch Query Studio.
Zu den abgeleiteten Kennzahlen zur Flottenplatzierung gehören:
-
Anzahl der Instanzen pro Verfügbarkeitszone
-
Anzahl der IC-Kopien pro Verfügbarkeitszone
-
AZ-Schräglage (prozentualer Anteil des Verteilungsungleichgewichts in Ihrer Flotte)
-
IC-Kopien pro Instanz
Diese Werte sind auf der Registerkarte Zuverlässigkeit des SageMaker AI Insights-Dashboards sichtbar.