View a markdown version of this page

OpenTelemetry riferimento alle metriche - Amazon SageMaker AI

Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.

OpenTelemetry riferimento alle metriche

Questa sezione fornisce un elenco completo (non esaustivo) delle OpenTelemetry metriche emesse dall'osservabilità dettagliata di SageMaker Amazon AI e disponibili in AI Insights. SageMaker

OpenTelemetry etichette metriche

OpenTelemetry le metriche includono etichette (attributi) che identificano la risorsa associata a ciascun punto dati. Utilizza queste etichette per filtrare e raggruppare le metriche nelle query.

OpenTelemetry etichetta Description
aws.sagemaker.endpoint.name Nome endpoint
aws.sagemaker.variant.name Nome della variante di produzione
aws.sagemaker.inference_component.name Nome del componente di inferenza
@resource.host.id ID istanza EC2
aws.sagemaker.container.id ID del contenitore
@resource.cloud.availability_zone Availability zone (Zona di disponibilità)
@resource.host.type Tipo di istanza

Account-level metriche aggregate

Queste metriche si riferiscono a livello di account.

# Metrica Description
1 TotalEndpoints Numero totale di endpoint attivi nell'account
2 TotalICs Numero totale di componenti di inferenza distribuiti su tutti gli endpoint
3 TotalInvocations Numero totale di richieste di inferenza su tutti gli endpoint

Metriche GPU (DCGM)

Queste metriche vengono raccolte dall'esportatore Data Center GPU Manager (DCGM) e sono disponibili su tutti gli endpoint GPU indipendentemente dal framework di inferenza.

Può essere aggregato a livello di componente di inferenza, istanza o endpoint.

# Metrica Metrica/e di origine Description
4 Utilizzo della GPU (%) DCGM_FI_DEV_GPU_UTIL Percentuale di tempo in cui la GPU ha eseguito attivamente i carichi di lavoro
5 Utilizzo della memoria GPU (%) DCGM_FI_DEV_MEM_COPY_UTIL Percentuale di tempo in cui il controller di memoria ha spostato attivamente i dati da o verso la memoria GPU

Metriche relative ai nodi (istanze)

Queste metriche vengono raccolte dall'esportatore del nodo e forniscono visibilità a livello di istanza sull'utilizzo di CPU, memoria e disco.

Può essere aggregato a livello di istanza o endpoint.

# Metrica Metrica/e di origine Description
6 Utilizzo della CPU (%) node_cpu_seconds_total Un contatore cumulativo che misura i secondi totali di CPU trascorsi in ciascuna modalità di esecuzione (inattiva, utente, sistema, iowait) dall'avvio. Ricava la percentuale di utilizzo dalla frequenza della modalità di inattività.
7 Utilizzo della memoria (%) node_memory_MemAvailable_bytes, node_memory_MemTotal_bytes Percentuale di memoria fisica in uso. Derivato dalla memoria totale meno la memoria disponibile.
8 Utilizzo del disco (%) node_filesystem_avail_bytes, node_filesystem_size_bytes Percentuale di spazio del file system in uso. Derivato dalla dimensione totale meno lo spazio disponibile.

Metriche del framework di inferenza (vLLm/SGlang)

Le metriche del framework di inferenza vengono emesse in modo nativo dal motore di servizio in esecuzione all'interno del contenitore del modello. SageMaker L'intelligenza artificiale raccoglie automaticamente queste metriche dai framework supportati (VLLm e sgLang) quando è abilitata l'osservabilità dettagliata. Queste metriche forniscono visibilità sulla velocità effettiva dei token, sulla latenza, sulla pressione della cache KV e sull'accodamento delle richieste a livello di componente di inferenza.

Queste metriche possono essere attribuite a livello di endpoint, componente di inferenza o istanza.

# Metrica Metrica/e di origine Description
9 Token di input al secondo vllm:prompt_tokens_total Numero totale di token prompt elaborati al secondo
10 Token di output al secondo vllm:generation_tokens_total Numero totale di token generati al secondo
11 TPS totale Derivato da #9 + #10 Token di input e output combinati al secondo
12 % di utilizzo del protocollo TPS Derivato da #11 Velocità effettiva attuale dei token come percentuale del picco osservato
13 TTFT vllm:time_to_first_token_seconds Tempo compreso tra l'arrivo della richiesta e il primo token generato (istogramma)
14 Inter-Token Latenza vllm:inter_token_latency_seconds Tempo medio tra token generati consecutivamente (istogramma)
15 Utilizzo della cache KV vllm:gpu_cache_usage_perc Percentuale di KV-cache memoria GPU attualmente in uso
16 Profondità della coda vllm:num_requests_waiting Numero di richieste in attesa di elaborazione in coda
17 Dimensione batch vllm:num_requests_running Numero di richieste attualmente in esecuzione (in corso)
18 Latenza del modello vllm:e2e_request_latency_seconds End-to-end latenza della richiesta dall'arrivo al token finale (istogramma)
Nota

Le metriche con il prefisso vllm: hanno sglang: controparti equivalenti per gli endpoint SGlang.

Operations-driven metriche

Queste metriche sono basate sugli eventi ed emesse dalle operazioni di creazione, aggiornamento o scala su un endpoint o un componente di inferenza. Non sono influenzate da. MetricPublishFrequencyInSeconds

Queste metriche possono essere attribuite a livello di endpoint e componente di inferenza.

# Metrica Metrica/e di origine Description
19 Evento di scalabilità e2e_duration Indica che sull'endpoint si è verificata un'azione di auto-scaling o di ridimensionamento manuale. Filtra per etichetta aws.sagemaker.scaling.direction (ScaleOutoScaleIn) per identificare la direzione.
20 Latenza di scalabilità E2E e2e_duration End-to-end ridimensionamento della durata dal trigger al completamento (secondi). Filtra per etichetta aws.sagemaker.operation.type (ad esempio,UpdateWCEndpoint).
21 Conteggio ICE ice_count Numero di eventi di errore di capacità insufficiente per AZ per tipo di istanza
22 Tipo di evento di ribilanciamento rebalancing_blocked Tipo di evento di ribilanciamento e relativo stato attuale
23 Durata del ribilanciamento rebalancing_duration Durata del ribilanciamento dall'inizio al completamento (secondi)
24 Copie IC spostate ic_copy_moved Numero di copie dei componenti di inferenza spostate durante il ribilanciamento
25 Istanze rilasciate instances_released Numero di istanze EC2 liberate dal consolidamento durante il ribilanciamento
26 Durata del download del modello model_download_time Tempo necessario per scaricare gli artefatti del modello da S3 all'istanza (secondi)
27 Durata del caricamento della GPU gpu_load_time Tempo di caricamento dei pesi del modello nella memoria della GPU (secondi)
28 Durata di avvio del contenitore container_start_time Tempo intercorso tra l'inizio del contenitore e il superamento del controllo di integrità (secondi)

Metriche derivate sul posizionamento della flotta

Oltre alle metriche sopra elencate, la dashboard di SageMaker AI Insights calcola metriche derivate dai dati di posizionamento del piano di controllo. Si tratta di viste aggregate visibili sulla dashboard e non sono nomi di metriche interrogabili singolarmente in Amazon Query Studio. CloudWatch

Le metriche derivate sul posizionamento della flotta includono:

  • Numero di istanze per zona di disponibilità

  • Numero di copie IC per zona di disponibilità

  • AZ skew (percentuale di squilibrio di distribuzione nell'intera flotta)

  • Copie IC per istanza

Questi valori sono visibili nella scheda Affidabilità della dashboard di SageMaker AI Insights.