Le traduzioni sono generate tramite traduzione automatica. In caso di conflitto tra il contenuto di una traduzione e la versione originale in Inglese, quest'ultima prevarrà.
OpenTelemetry riferimento alle metriche
Questa sezione fornisce un elenco completo (non esaustivo) delle OpenTelemetry metriche emesse dall'osservabilità dettagliata di SageMaker Amazon AI e disponibili in AI Insights. SageMaker
OpenTelemetry etichette metriche
OpenTelemetry le metriche includono etichette (attributi) che identificano la risorsa associata a ciascun punto dati. Utilizza queste etichette per filtrare e raggruppare le metriche nelle query.
| OpenTelemetry etichetta | Description |
|---|---|
aws.sagemaker.endpoint.name |
Nome endpoint |
aws.sagemaker.variant.name |
Nome della variante di produzione |
aws.sagemaker.inference_component.name |
Nome del componente di inferenza |
@resource.host.id |
ID istanza EC2 |
aws.sagemaker.container.id |
ID del contenitore |
@resource.cloud.availability_zone |
Availability zone (Zona di disponibilità) |
@resource.host.type |
Tipo di istanza |
Account-level metriche aggregate
Queste metriche si riferiscono a livello di account.
| # | Metrica | Description |
|---|---|---|
| 1 | TotalEndpoints |
Numero totale di endpoint attivi nell'account |
| 2 | TotalICs |
Numero totale di componenti di inferenza distribuiti su tutti gli endpoint |
| 3 | TotalInvocations |
Numero totale di richieste di inferenza su tutti gli endpoint |
Metriche GPU (DCGM)
Queste metriche vengono raccolte dall'esportatore Data Center GPU Manager (DCGM) e sono disponibili su tutti gli endpoint GPU indipendentemente dal framework di inferenza.
Può essere aggregato a livello di componente di inferenza, istanza o endpoint.
| # | Metrica | Metrica/e di origine | Description |
|---|---|---|---|
| 4 | Utilizzo della GPU (%) | DCGM_FI_DEV_GPU_UTIL |
Percentuale di tempo in cui la GPU ha eseguito attivamente i carichi di lavoro |
| 5 | Utilizzo della memoria GPU (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
Percentuale di tempo in cui il controller di memoria ha spostato attivamente i dati da o verso la memoria GPU |
Metriche relative ai nodi (istanze)
Queste metriche vengono raccolte dall'esportatore del nodo e forniscono visibilità a livello di istanza sull'utilizzo di CPU, memoria e disco.
Può essere aggregato a livello di istanza o endpoint.
| # | Metrica | Metrica/e di origine | Description |
|---|---|---|---|
| 6 | Utilizzo della CPU (%) | node_cpu_seconds_total |
Un contatore cumulativo che misura i secondi totali di CPU trascorsi in ciascuna modalità di esecuzione (inattiva, utente, sistema, iowait) dall'avvio. Ricava la percentuale di utilizzo dalla frequenza della modalità di inattività. |
| 7 | Utilizzo della memoria (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
Percentuale di memoria fisica in uso. Derivato dalla memoria totale meno la memoria disponibile. |
| 8 | Utilizzo del disco (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
Percentuale di spazio del file system in uso. Derivato dalla dimensione totale meno lo spazio disponibile. |
Metriche del framework di inferenza (vLLm/SGlang)
Le metriche del framework di inferenza vengono emesse in modo nativo dal motore di servizio in esecuzione all'interno del contenitore del modello. SageMaker L'intelligenza artificiale raccoglie automaticamente queste metriche dai framework supportati (VLLm e sgLang) quando è abilitata l'osservabilità dettagliata. Queste metriche forniscono visibilità sulla velocità effettiva dei token, sulla latenza, sulla pressione della cache KV e sull'accodamento delle richieste a livello di componente di inferenza.
Queste metriche possono essere attribuite a livello di endpoint, componente di inferenza o istanza.
| # | Metrica | Metrica/e di origine | Description |
|---|---|---|---|
| 9 | Token di input al secondo | vllm:prompt_tokens_total |
Numero totale di token prompt elaborati al secondo |
| 10 | Token di output al secondo | vllm:generation_tokens_total |
Numero totale di token generati al secondo |
| 11 | TPS totale | Derivato da #9 + #10 | Token di input e output combinati al secondo |
| 12 | % di utilizzo del protocollo TPS | Derivato da #11 | Velocità effettiva attuale dei token come percentuale del picco osservato |
| 13 | TTFT | vllm:time_to_first_token_seconds |
Tempo compreso tra l'arrivo della richiesta e il primo token generato (istogramma) |
| 14 | Inter-Token Latenza | vllm:inter_token_latency_seconds |
Tempo medio tra token generati consecutivamente (istogramma) |
| 15 | Utilizzo della cache KV | vllm:gpu_cache_usage_perc |
Percentuale di KV-cache memoria GPU attualmente in uso |
| 16 | Profondità della coda | vllm:num_requests_waiting |
Numero di richieste in attesa di elaborazione in coda |
| 17 | Dimensione batch | vllm:num_requests_running |
Numero di richieste attualmente in esecuzione (in corso) |
| 18 | Latenza del modello | vllm:e2e_request_latency_seconds |
End-to-end latenza della richiesta dall'arrivo al token finale (istogramma) |
Nota
Le metriche con il prefisso vllm: hanno sglang: controparti equivalenti per gli endpoint SGlang.
Operations-driven metriche
Queste metriche sono basate sugli eventi ed emesse dalle operazioni di creazione, aggiornamento o scala su un endpoint o un componente di inferenza. Non sono influenzate da. MetricPublishFrequencyInSeconds
Queste metriche possono essere attribuite a livello di endpoint e componente di inferenza.
| # | Metrica | Metrica/e di origine | Description |
|---|---|---|---|
| 19 | Evento di scalabilità | e2e_duration |
Indica che sull'endpoint si è verificata un'azione di auto-scaling o di ridimensionamento manuale. Filtra per etichetta aws.sagemaker.scaling.direction (ScaleOutoScaleIn) per identificare la direzione. |
| 20 | Latenza di scalabilità E2E | e2e_duration |
End-to-end ridimensionamento della durata dal trigger al completamento (secondi). Filtra per etichetta aws.sagemaker.operation.type (ad esempio,UpdateWCEndpoint). |
| 21 | Conteggio ICE | ice_count |
Numero di eventi di errore di capacità insufficiente per AZ per tipo di istanza |
| 22 | Tipo di evento di ribilanciamento | rebalancing_blocked |
Tipo di evento di ribilanciamento e relativo stato attuale |
| 23 | Durata del ribilanciamento | rebalancing_duration |
Durata del ribilanciamento dall'inizio al completamento (secondi) |
| 24 | Copie IC spostate | ic_copy_moved |
Numero di copie dei componenti di inferenza spostate durante il ribilanciamento |
| 25 | Istanze rilasciate | instances_released |
Numero di istanze EC2 liberate dal consolidamento durante il ribilanciamento |
| 26 | Durata del download del modello | model_download_time |
Tempo necessario per scaricare gli artefatti del modello da S3 all'istanza (secondi) |
| 27 | Durata del caricamento della GPU | gpu_load_time |
Tempo di caricamento dei pesi del modello nella memoria della GPU (secondi) |
| 28 | Durata di avvio del contenitore | container_start_time |
Tempo intercorso tra l'inizio del contenitore e il superamento del controllo di integrità (secondi) |
Metriche derivate sul posizionamento della flotta
Oltre alle metriche sopra elencate, la dashboard di SageMaker AI Insights calcola metriche derivate dai dati di posizionamento del piano di controllo. Si tratta di viste aggregate visibili sulla dashboard e non sono nomi di metriche interrogabili singolarmente in Amazon Query Studio. CloudWatch
Le metriche derivate sul posizionamento della flotta includono:
-
Numero di istanze per zona di disponibilità
-
Numero di copie IC per zona di disponibilità
-
AZ skew (percentuale di squilibrio di distribuzione nell'intera flotta)
-
Copie IC per istanza
Questi valori sono visibili nella scheda Affidabilità della dashboard di SageMaker AI Insights.