As traduções são geradas por tradução automática. Em caso de conflito entre o conteúdo da tradução e da versão original em inglês, a versão em inglês prevalecerá.
OpenTelemetry referência de métricas
Esta seção fornece uma lista abrangente (não exaustiva) de OpenTelemetry métricas emitidas pela SageMaker Amazon AI, observabilidade detalhada e disponíveis no AI Insights. SageMaker
OpenTelemetry rótulos métricos
OpenTelemetry as métricas incluem rótulos (atributos) que identificam o recurso associado a cada ponto de dados. Use esses rótulos para filtrar e agrupar métricas em consultas.
| OpenTelemetry rótulo | Description |
|---|---|
aws.sagemaker.endpoint.name |
Nome do endpoint |
aws.sagemaker.variant.name |
Nome da variante de produção |
aws.sagemaker.inference_component.name |
Nome do componente de inferência |
@resource.host.id |
IDs de instância EC2 |
aws.sagemaker.container.id |
ID do contêiner |
@resource.cloud.availability_zone |
Zona de disponibilidade |
@resource.host.type |
Tipo de instância |
Account-level métricas agregadas
Essas métricas estão no nível da conta.
| # | Métrica | Description |
|---|---|---|
| 1 | TotalEndpoints |
Número total de endpoints ativos na conta |
| 2 | TotalICs |
Número total de componentes de inferência implantados em todos os endpoints |
| 3 | TotalInvocations |
Número total de solicitações de inferência em todos os endpoints |
Métricas de GPU (DCGM)
Essas métricas são coletadas do exportador do Data Center GPU Manager (DCGM) e estão disponíveis em todos os endpoints da GPU, independentemente da estrutura de inferência.
Pode ser agregado no nível do componente de inferência, instância ou endpoint.
| # | Métrica | Métrica (s) de origem | Description |
|---|---|---|---|
| 4 | Utilização da GPU (%) | DCGM_FI_DEV_GPU_UTIL |
Porcentagem de tempo em que a GPU estava executando cargas de trabalho ativamente |
| 5 | Utilização da memória da GPU (%) | DCGM_FI_DEV_MEM_COPY_UTIL |
Porcentagem de tempo em que o controlador de memória estava movendo dados ativamente de ou para a memória da GPU |
Métricas de nós (instância)
Essas métricas são coletadas do exportador de nós e fornecem visibilidade em nível de instância sobre a utilização da CPU, da memória e do disco.
Pode ser agregado no nível da instância ou do endpoint.
| # | Métrica | Métrica (s) de origem | Description |
|---|---|---|---|
| 6 | Utilização da CPU (%) | node_cpu_seconds_total |
Um contador cumulativo que mede o total de segundos de CPU gastos em cada modo de execução (inativo, usuário, sistema, iowait) desde a inicialização. Derive a porcentagem de utilização da taxa do modo inativo. |
| 7 | Utilização da memória (%) | node_memory_MemAvailable_bytes,
node_memory_MemTotal_bytes |
Porcentagem de memória física em uso. Derivado da memória total menos a memória disponível. |
| 8 | Utilização do disco (%) | node_filesystem_avail_bytes,
node_filesystem_size_bytes |
Porcentagem do espaço do sistema de arquivos em uso. Derivado do tamanho total menos o espaço disponível. |
Métricas da estrutura de inferência (vLLM/SGlang)
As métricas da estrutura de inferência são emitidas nativamente pelo mecanismo de serviço executado dentro do contêiner do modelo. SageMaker A IA coleta automaticamente essas métricas das estruturas suportadas (vLLM e SGlang) quando a observabilidade detalhada é ativada. Essas métricas fornecem visibilidade da taxa de transferência do token, da latência, da pressão do cache KV e do enfileiramento de solicitações no nível do componente de inferência.
Essas métricas podem ser atribuídas no nível do endpoint, do componente de inferência ou da instância.
| # | Métrica | Métrica (s) de origem | Description |
|---|---|---|---|
| 9 | Tokens de entrada por segundo | vllm:prompt_tokens_total |
Número total de tokens de alerta processados por segundo |
| 10 | Tokens de saída por segundo | vllm:generation_tokens_total |
Número total de tokens gerados por segundo |
| 11 | Total de TPS | Derivado de #9 + #10 | Tokens combinados de entrada e saída por segundo |
| 12 | % de utilização do TPS | Derivado de #11 | Taxa de transferência atual do token como uma porcentagem do pico observado |
| 13 | TTFT | vllm:time_to_first_token_seconds |
Tempo desde a chegada da solicitação até o primeiro token gerado (histograma) |
| 14 | Inter-Token Latência | vllm:inter_token_latency_seconds |
Tempo médio entre tokens gerados consecutivamente (histograma) |
| 15 | Utilização do cache KV | vllm:gpu_cache_usage_perc |
Porcentagem da KV-cache memória da GPU atualmente em uso |
| 16 | Profundidade da fila | vllm:num_requests_waiting |
Número de solicitações aguardando na fila para serem processadas |
| 17 | Tamanho do lote | vllm:num_requests_running |
Número de solicitações atualmente em execução (em andamento) |
| 18 | Latência do modelo | vllm:e2e_request_latency_seconds |
End-to-end latência da solicitação desde a chegada até o token final (histograma) |
nota
As métricas prefixadas com vllm: têm sglang: equivalentes para endpoints SGlang.
Operations-driven métricas
Essas métricas são orientadas por eventos e emitidas por suas operações de criação, atualização ou escala para um endpoint ou componente de inferência. Eles não são afetados porMetricPublishFrequencyInSeconds.
Essas métricas podem ser atribuídas no nível do endpoint e do componente de inferência.
| # | Métrica | Métrica (s) de origem | Description |
|---|---|---|---|
| 19 | Evento de escalonamento | e2e_duration |
Indica que uma ação de escalonamento automático ou manual ocorreu em seu endpoint. Filtre por etiqueta aws.sagemaker.scaling.direction (ScaleOutouScaleIn) para identificar a direção. |
| 20 | Latência de escalabilidade E2E | e2e_duration |
End-to-end escalando a duração do gatilho até a conclusão (segundos). Filtrar por rótulo aws.sagemaker.operation.type (por exemplo,UpdateWCEndpoint). |
| 21 | Contagem de ICE | ice_count |
Número de eventos de erro de capacidade insuficiente por AZ por tipo de instância |
| 22 | Tipo de evento de rebalanceamento | rebalancing_blocked |
Tipo de evento de rebalanceamento e seu estado atual |
| 23 | Duração do rebalanceamento | rebalancing_duration |
Duração do rebalanceamento do início até a conclusão (segundos) |
| 24 | Cópias do IC movidas | ic_copy_moved |
Número de cópias do componente de inferência movidas durante o rebalanceamento |
| 25 | Instâncias lançadas | instances_released |
Número de instâncias do EC2 liberadas pela consolidação durante o rebalanceamento |
| 26 | Duração do download do modelo | model_download_time |
Tempo para baixar artefatos do modelo do S3 para a instância (segundos) |
| 27 | Duração do carregamento da GPU | gpu_load_time |
Tempo para carregar os pesos do modelo na memória da GPU (segundos) |
| 28 | Duração do início do contêiner | container_start_time |
Tempo desde o início do contêiner até a aprovação na verificação de saúde (segundos) |
Métricas derivadas de posicionamento da frota
Além das métricas listadas acima, o painel do SageMaker AI Insights calcula métricas derivadas dos dados de posicionamento do plano de controle. Essas são visualizações agregadas visíveis no painel e não são nomes de métricas que podem ser consultados individualmente no Amazon CloudWatch Query Studio.
As métricas derivadas de posicionamento da frota incluem:
-
Contagem de instâncias por zona de disponibilidade
-
Contagem de cópias do IC por zona de disponibilidade
-
Inclinação de AZ (porcentagem de desequilíbrio de distribuição em toda a sua frota)
-
Cópias de IC por instância
Esses valores são visíveis na guia Confiabilidade do painel do SageMaker AI Insights.